21.09.2026 | Research

Sprachmodelle für die Messung von Unternehmensrisiken

Große Sprachmodelle können die empirische Auswertung von Unternehmenskommunikation systematisch verzerren, wenn ihre Ratings als gleichwertig mit beobachteten Kennzahlen wie Umsatz oder Leverage verwendet werden. Zu diesem Schluss kommt ein Forschungspaper von drei Universitäten in den USA. Besonders ausgeprägt ist die Verzerrung durch lange Risikohinweise aus 10-K-Berichten. Kürzere Earnings-Call-Texte und zielgerichtete Einzelabfragen weisen geringere Belastungen auf.

Die Autoren untersuchen vier Modelle (GPT-4o-mini, Grok-3-mini, Phi-4 und Llama-3.3-70B) anhand von knapp 900.000 Risikofaktor-Offenlegungen von 1.675 S&P-500-Unternehmen aus den Jahren 2005 bis 2024. Ergänzend analysieren sie 100.000 Earnings-Call-Transkripte. Im Zentrum stehen zwei Indikatoren: „Omission“ erfasst den Anteil markanter Begriffe aus dem Ausgangstext, die im Modelloutput fehlen; „Injection“ misst neu eingeführte Begriffe ohne Entsprechung im Quelltext.

 

 

Quelle: J. Anthony Cookson (Pennsylvania State University), Maryam Fathollahi (University of Oklahoma), William Grieser (Oklahoma State University), Eshwar Venugopal (University of Alabama)

Die Auswertung zeigt, dass die Modelle 59 bis 73 % der 1.000 markantesten Begriffe einer Risikoffenlegung auslassen. Zwischen 15 und 35 % des unterscheidungskräftigen Vokabulars in den Zusammenfassungen stammen nicht aus dem Ursprungstext. Je nach Modell gehen damit 37 bis 51 % des semantischen Inhalts verloren. Zudem verdichten die Zusammenfassungen negative, unsichere und vorsichtig formulierte Sprache.

 

 

Quelle: J. Anthony Cookson (Pennsylvania State University), Maryam Fathollahi (University of Oklahoma), William Grieser (Oklahoma State University), Eshwar Venugopal (University of Alabama)

Für institutionelle Investoren ist relevant, dass solche LLM-generierten Größen als modellproduzierte Regressoren behandelt werden sollten. In 69 % der untersuchten Konstellationen veränderte die Berücksichtigung von Omission und Injection die Koeffizienten um mindestens zehn Prozent. Bei fokussierten Direktabfragen fiel die mediane Sensitivität von 21 % für Ratings aus Item-1A-Texten auf unter sieben Prozent. Die Autoren empfehlen, beide Indikatoren offenzulegen, Diagnosetests vorzuschalten und modellübergreifende Übereinstimmung als Qualitätsfilter zu nutzen.


Absolut Research unterstützt institutionelle Investoren bei der Bewertung von Mandaten und der Selektion neuer Asset Manager mit der monatlich erscheinenden Publikationsreihe Absolut|ranking und den 360°-Analysen (Peer-/ Benchmark-/ Factor-/ Asset-Flow-/ Persistence-Analysen). Insgesamt analysiert Absolut|ranking mehr als 16.000 aktive und passive Strategien von 2.000 Asset Managern, aufgeteilt auf 34 Assetklassen und Marktsegmente sowie mehr als 200 Universen. Individuelle Mandate und Spezialfonds können ebenfalls untersucht werden.

Abonnenten von Absolut Research können weiterführende Informationen hier herunterladen:
Mehr zum Thema "LLMs"
zurück