Misinformation bei LLMs: falsche Ausgaben erkennen und abfangen
OWASP LLM09: Misinformation
Misinformation bezeichnet in der OWASP-Liste die falsche oder irreführende Ausgabe eines Sprachmodells, die glaubwürdig klingt. Sie entsteht ohne Angreifer, allein aus der Arbeitsweise des Modells, und richtet Schaden an, sobald jemand sie ungeprüft übernimmt. Der Schutz liegt deshalb nicht im Modell, sondern im Ablauf davor und danach: geprüfte Unterlagen als Grundlage der Antwort, eine Gegenprüfung an den Stellen mit Folgen.
Warum die Liste den Blick auf die Ausgabe dreht
Bis zur Fassung 2023/24 hieß dieser Punkt der OWASP-Liste zu LLM-Anwendungen „Overreliance“ und beschrieb damit das Verhalten des Menschen: zu viel Vertrauen in die Maschine. Seit der Fassung 2025 heißt er „Misinformation“ und benennt die Eigenschaft der Ausgabe. Overreliance steht weiter in der Beschreibung, jetzt als Verstärker des Schadens.
Der Unterschied klingt akademisch und ändert in der Praxis, wo die Maßnahme ansetzt. Wer das Problem beim Vertrauen des Nutzers verortet, landet bei einer Dienstanweisung: Bitte kritisch prüfen. Diese Anweisung verlagert die Verantwortung auf die Person, die am wenigsten beurteilen kann, wie sicher eine Antwort ist. Wer das Problem bei der Ausgabe verortet, fragt stattdessen nach der Grundlage der Antwort und nach dem Weg, den sie danach nimmt. Beides lässt sich technisch und organisatorisch beeinflussen, das Vertrauen einer Person nur bedingt.
Wie eine falsche Auskunft entsteht
Ein Sprachmodell setzt Text fort, der zu den gelernten Mustern passt. Es schlägt nichts nach und prüft nichts, es schätzt die wahrscheinlichste Fortsetzung. Wo das Trainingsmaterial eine Lücke hat, wird diese Lücke mit einer Formulierung gefüllt, die zum Muster passt. Genau das ist eine Halluzination. Sie ist kein Defekt, sie ist die Kehrseite derselben Fähigkeit, die das Modell nützlich macht.
Dazu kommt eine zweite Quelle, die weniger auffällt: Was im Trainingsmaterial schief liegt, kommt auch schief wieder heraus. Veraltete Rechtslagen und schlicht falsche Angaben aus dem offenen Netz sind Teil dessen, worauf ein allgemeines Modell gelernt hat.
Ein Warnsignal gibt es in beiden Fällen nicht. Die Antwort auf eine Frage, zu der das Modell nichts weiß, ist genauso flüssig formuliert wie jede andere. Dieselbe Beobachtung beschreibt unser Märchen über Sprachmodelle aus der Sicht eines Lesers, der zum ersten Mal damit zu tun hat.
Vier Formen, die OWASP unterscheidet
Falsche Tatsachenbehauptung. Das Modell gibt eine konkrete Auskunft, die nicht stimmt. OWASP führt als Beispiel den Chatbot von Air Canada an, der Reisenden die eigenen Tarifbedingungen falsch erklärte; das Unternehmen musste vor Gericht für die Auskunft seines Systems einstehen. Für einen Mittelbetrieb liegt dieser Fall besonders nah, weil ein Chatbot auf der eigenen Website dieselbe Rolle hat: Er spricht im Namen des Unternehmens.
Behauptung ohne Grundlage. Das Modell erfindet Belege, die es nie gegeben hat. OWASP nennt dafür einen Anwaltsschriftsatz mit Urteilszitaten, die aus dem Modell und nicht aus der Rechtsprechung stammten. Heikel wird diese Form überall dort, wo eine Aussage üblicherweise mit einer Quelle daherkommt und die Quelle deshalb nicht mehr geprüft wird.
Vorgetäuschte Fachkenntnis. Die Antwort klingt nach Fachwissen und ist zu glatt für die Sache. OWASP nennt Gesundheitsauskünfte, bei denen ein Modell die Komplexität eines Krankheitsbildes verkürzt darstellt. In der betrieblichen Anwendung trifft dasselbe Muster technische Auskünfte: Ein Modell, das eine Norm zusammenfasst, liefert einen lesbaren Absatz und lässt die Ausnahme weg.
Erfundener oder unsicherer Quellcode. Das Modell schlägt Bibliotheken vor, die es nicht gibt, oder Verfahren, die als überholt gelten. Wer den Vorschlag übernimmt, holt sich eine Schwachstelle ins Projekt, ohne eine Zeile davon bewusst geschrieben zu haben.
Der Punkt, an dem daraus ein Angriff wird
Die vierte Form hat eine Seite, die Misinformation von einem Qualitätsproblem zu einer Schwachstelle macht. Ein Angreifer beobachtet, welche Paketnamen ein Coding-Assistent immer wieder erfindet, und legt genau diese Pakete unter dem erfundenen Namen im öffentlichen Register an, gefüllt mit Schadcode. Der nächste Entwickler, dem das Modell denselben Namen vorschlägt, installiert ihn und holt sich damit fremden Code in den Build.
Der Weg hinein führt über eine Halluzination, der Schaden entsteht in der Lieferkette. Wie sich die zugelieferten Bausteine einer KI-Anwendung prüfen lassen, steht auf unserer Seite zu Supply Chain.
Overreliance als Verstärker
Der alte Name des Punktes beschreibt die Hälfte, die sich nicht abschalten lässt. Eine Modellantwort kommt sofort und fertig formuliert, ohne die Reibung einer eigenen Recherche. Je fertiger eine Ausgabe aussieht, desto weniger wird sie gelesen. Wer eine Zusammenfassung von zehn Seiten Vertrag bekommt, liest die zehn Seiten danach in der Regel nicht mehr, und genau darin liegt der Nutzen der Zusammenfassung.
Deshalb hilft der Appell an die Wachsamkeit wenig. Was hilft, ist der Zuschnitt der Aufgabe: Ein Modell, das die Fundstelle im Vertrag zeigt, statt sie zu ersetzen, verlangt vom Leser dieselbe halbe Minute und lässt ihm die Kontrolle. Wer mit KI-Werkzeugen arbeitet, sollte deren Grenzen kennen; dafür gibt es unsere KI-Schulungen.
Was im Betrieb tatsächlich trägt
Grundlage geben, statt Wissen abfragen. Ein Assistent, der seine Antworten aus Ihren freigegebenen Dokumenten zieht (Retrieval Augmented Generation), entzieht der Halluzination den Anlass. Diese Bauweise ist der Normalfall bei einem KI-Chatbot im Unternehmen und gehört in jedes Lastenheft.
Die Quelle mit ausgeben. Eine Antwort mit Verweis auf das Dokument, aus dem sie stammt, ist prüfbar. Eine Antwort ohne Verweis ist es nicht. Der Aufwand dafür fällt einmal bei der Einrichtung an.
Automatisch prüfen, wo es automatisch geht. Generierter Quellcode durchläuft die vorhandene Testsuite und die Sicherheitsprüfung wie jeder andere Code auch. Ein Paketname, den es nicht gibt, fällt dabei sofort auf; einer, den ein Angreifer eigens angelegt hat, nicht. Deshalb gehört die Herkunft jeder neuen Abhängigkeit dazu.
Menschlich freigeben, wo es Folgen hat. Eine Freigabe braucht einen Namen und einen Zeitpunkt vor der Wirkung. Wo beides fehlt, findet sie nicht statt, auch wenn sie in einer Richtlinie steht.
Sagen, dass eine KI antwortet. Ein erkennbar gekennzeichneter Assistent wird anders gelesen als eine Auskunft, die aus dem Nichts kommt. Für Systeme, die direkt mit Personen sprechen, verlangt der EU AI Act diese Kennzeichnung ohnehin.
Fazit
Ein Sprachmodell erzeugt Sprache und keine Wahrheit. Diese Eigenschaft lässt sich nicht wegkonfigurieren, und deshalb verschiebt sich die Frage von der Technik auf den Ablauf: Woher nimmt eine Antwort ihre Grundlage, wer sieht sie vor ihrer Wirkung, und was passiert, wenn sie falsch war? Die dritte Frage entscheidet darüber, wie groß der Schaden wird. Wo die eigene KI-Anwendung dabei steht, klärt eine Sicherheitsbetrachtung für KI-Systeme.