Unternehmensberichte und systematisches Risiko auf Aktienmärkten
Seit Ende 2015 sind öffentlich gelistete Unternehmen in den USA dazu verpflichtet, im Rahmen ihrer regelmäßigen Berichte auf die für das Unternehmensgeschäft relevanten Risikofaktoren einzugehen.
Bei der wissenschaftlichen Diskussion dieses Risikofaktorreportings steht im Mittelpunkt, ob die Vorgaben seitens der Securities and Exchange Commission (SEC) zum größtmöglichen Abbau von Informationsasymmetrien zwischen Unternehmensleitung und Investoren führen. Während zahlreiche Studien die Vorgaben in der jetzigen Form für wenig zweckdienlich halten, ist bislang unklar, ob der Grund hierfür in unspezifischen Berichten der Unternehmen oder in der mangelhaften Interpretation der Berichte durch die Investoren liegt.
Dr. Müller möchte diese Frage versuchen zu beantworten, indem er untersucht, welche systematischen Risiken von den Unternehmen tatsächlich im Risikofaktorreporting adressiert werden. Zudem analysiert er, welche dieser Risiken von den Investoren bei der Bewertung der Aktien im Anschluss an die Berichte berücksichtigt werden.
Im ersten Teil des Vorhabens wird eine Datenbank aufgebaut, die sowohl Medienberichte über unternehmensrelevante Informationen als auch die Unternehmensberichte enthält. Die Medienberichte werden verwendet, um mit Hilfe von Deep-Learning-Verfahren Risikofaktoren mit Inhalten zu verknüpfen. Die zu entwickelnde Datenbank wird als NoSQL-Datenbank implementiert, um die unterschiedlichen Formate der einbezogenen Daten einfacher verarbeiten zu können. Bereits bei der Befüllung aus den Quelldatenbanken wird die Informationsmenge reduziert, indem ein bereits trainiertes maschinelles Lernverfahren zur Verknüpfung von Entitäten eingesetzt wird. Es werden nur Textartikel in die Datenbank aufgenommen, die mit einer bestimmten Wahrscheinlichkeit mit mindestens einem Unternehmen aus den anderen Bereichen der Datenbank assoziiert sind.
Die benötigten Aktiendaten, zum Beispiel für den S&P 500 Index, stammen aus den Datenbanken Center for Research and Security Prices (CRSP), Compustat, Bloomberg und Morningstar. Die Datenbank Ravenpack stellt Zeitungsartikel und Blogeinträge bereit. Diese sind mit Informationslabels und Entitätslabels versehen, die eine Gruppierung ermöglichen. Für obligatorische Unternehmensberichte wird auf die Datenbank EDGAR zurückgegriffen.
Im zweiten Teil des Vorhabens wird mit Hilfe der Datenbank analysiert, welche systematischen Risiken Unternehmen tatsächlich berichten und welche Risiken von den Investoren mit welcher zeitlichen Verzögerung bei der Bewertung von Aktien berücksichtigt werden. Dazu werden im ersten Schritt – basierend auf Labels, die aus Renditen etablierter Faktorportfolios abgeleitet werden – Medienartikel auf dem Weg des maschinellen Lernens in Vektorrepräsentationen überführt und Faktorcluster bestimmt. Das so trainierte neuronale Netzwerk wird im zweiten Schritt zur Transformation der relevanten Risikoberichte eingesetzt. Abschließend erfolgt die Zuordnung von Transformationen aus dem zweiten Schritt zu den Faktorclustern aus dem ersten Schritt. Die Assoziation der Risikofaktoren mit den Inhalten einerseits und die Assoziation der Unternehmensberichte mit den Risikofaktoren andererseits basieren auf zwei unterschiedlichen Datensätzen. Dadurch kann bei der Analyse zwischen der Problematik der unspezifischen Berichte der Unternehmen und der Problematik der mangelhaften Interpretation der Investoren unterschieden werden.
Über diese Fragestellung hinaus möchte Dr. Müller einen Beitrag zum besseren Verständnis des systematischen Risikos auf Aktienmärkten anhand der in den Unternehmensberichten offenbarten Inhalte leisten. Bislang hat sich die Forschung wesentlich auf die Identifikation abstrakter Risikofaktoren auf Märkten konzentriert. Es herrscht wenig Klarheit darüber, welche tatsächlichen Inhalte hinter den abstrakten Faktoren stehen.