we-make.ai

Misinformation bei LLMs: falsche Ausgaben erkennen und abfangen

OWASP LLM09: Misinformation

Misinformation bezeichnet in der OWASP-Liste die falsche oder irreführende Ausgabe eines Sprachmodells, die glaubwürdig klingt. Sie entsteht ohne Angreifer, allein aus der Arbeitsweise des Modells, und richtet Schaden an, sobald jemand sie ungeprüft übernimmt. Der Schutz liegt deshalb nicht im Modell, sondern im Ablauf davor und danach: geprüfte Unterlagen als Grundlage der Antwort, eine Gegenprüfung an den Stellen mit Folgen.

Warum die Liste den Blick auf die Ausgabe dreht

Bis zur Fassung 2023/24 hieß dieser Punkt der OWASP-Liste zu LLM-Anwendungen „Overreliance“ und beschrieb damit das Verhalten des Menschen: zu viel Vertrauen in die Maschine. Seit der Fassung 2025 heißt er „Misinformation“ und benennt die Eigenschaft der Ausgabe. Overreliance steht weiter in der Beschreibung, jetzt als Verstärker des Schadens.

Der Unterschied klingt akademisch und ändert in der Praxis, wo die Maßnahme ansetzt. Wer das Problem beim Vertrauen des Nutzers verortet, landet bei einer Dienstanweisung: Bitte kritisch prüfen. Diese Anweisung verlagert die Verantwortung auf die Person, die am wenigsten beurteilen kann, wie sicher eine Antwort ist. Wer das Problem bei der Ausgabe verortet, fragt stattdessen nach der Grundlage der Antwort und nach dem Weg, den sie danach nimmt. Beides lässt sich technisch und organisatorisch beeinflussen, das Vertrauen einer Person nur bedingt.

Wie eine falsche Auskunft entsteht

Ein Sprachmodell setzt Text fort, der zu den gelernten Mustern passt. Es schlägt nichts nach und prüft nichts, es schätzt die wahrscheinlichste Fortsetzung. Wo das Trainingsmaterial eine Lücke hat, wird diese Lücke mit einer Formulierung gefüllt, die zum Muster passt. Genau das ist eine Halluzination. Sie ist kein Defekt, sie ist die Kehrseite derselben Fähigkeit, die das Modell nützlich macht.

Dazu kommt eine zweite Quelle, die weniger auffällt: Was im Trainingsmaterial schief liegt, kommt auch schief wieder heraus. Veraltete Rechtslagen und schlicht falsche Angaben aus dem offenen Netz sind Teil dessen, worauf ein allgemeines Modell gelernt hat.

Ein Warnsignal gibt es in beiden Fällen nicht. Die Antwort auf eine Frage, zu der das Modell nichts weiß, ist genauso flüssig formuliert wie jede andere. Dieselbe Beobachtung beschreibt unser Märchen über Sprachmodelle aus der Sicht eines Lesers, der zum ersten Mal damit zu tun hat.

Vier Formen, die OWASP unterscheidet

Falsche Tatsachenbehauptung. Das Modell gibt eine konkrete Auskunft, die nicht stimmt. OWASP führt als Beispiel den Chatbot von Air Canada an, der Reisenden die eigenen Tarifbedingungen falsch erklärte; das Unternehmen musste vor Gericht für die Auskunft seines Systems einstehen. Für einen Mittelbetrieb liegt dieser Fall besonders nah, weil ein Chatbot auf der eigenen Website dieselbe Rolle hat: Er spricht im Namen des Unternehmens.

Behauptung ohne Grundlage. Das Modell erfindet Belege, die es nie gegeben hat. OWASP nennt dafür einen Anwaltsschriftsatz mit Urteilszitaten, die aus dem Modell und nicht aus der Rechtsprechung stammten. Heikel wird diese Form überall dort, wo eine Aussage üblicherweise mit einer Quelle daherkommt und die Quelle deshalb nicht mehr geprüft wird.

Vorgetäuschte Fachkenntnis. Die Antwort klingt nach Fachwissen und ist zu glatt für die Sache. OWASP nennt Gesundheitsauskünfte, bei denen ein Modell die Komplexität eines Krankheitsbildes verkürzt darstellt. In der betrieblichen Anwendung trifft dasselbe Muster technische Auskünfte: Ein Modell, das eine Norm zusammenfasst, liefert einen lesbaren Absatz und lässt die Ausnahme weg.

Erfundener oder unsicherer Quellcode. Das Modell schlägt Bibliotheken vor, die es nicht gibt, oder Verfahren, die als überholt gelten. Wer den Vorschlag übernimmt, holt sich eine Schwachstelle ins Projekt, ohne eine Zeile davon bewusst geschrieben zu haben.

Der Punkt, an dem daraus ein Angriff wird

Die vierte Form hat eine Seite, die Misinformation von einem Qualitätsproblem zu einer Schwachstelle macht. Ein Angreifer beobachtet, welche Paketnamen ein Coding-Assistent immer wieder erfindet, und legt genau diese Pakete unter dem erfundenen Namen im öffentlichen Register an, gefüllt mit Schadcode. Der nächste Entwickler, dem das Modell denselben Namen vorschlägt, installiert ihn und holt sich damit fremden Code in den Build.

Der Weg hinein führt über eine Halluzination, der Schaden entsteht in der Lieferkette. Wie sich die zugelieferten Bausteine einer KI-Anwendung prüfen lassen, steht auf unserer Seite zu Supply Chain.

Overreliance als Verstärker

Der alte Name des Punktes beschreibt die Hälfte, die sich nicht abschalten lässt. Eine Modellantwort kommt sofort und fertig formuliert, ohne die Reibung einer eigenen Recherche. Je fertiger eine Ausgabe aussieht, desto weniger wird sie gelesen. Wer eine Zusammenfassung von zehn Seiten Vertrag bekommt, liest die zehn Seiten danach in der Regel nicht mehr, und genau darin liegt der Nutzen der Zusammenfassung.

Deshalb hilft der Appell an die Wachsamkeit wenig. Was hilft, ist der Zuschnitt der Aufgabe: Ein Modell, das die Fundstelle im Vertrag zeigt, statt sie zu ersetzen, verlangt vom Leser dieselbe halbe Minute und lässt ihm die Kontrolle. Wer mit KI-Werkzeugen arbeitet, sollte deren Grenzen kennen; dafür gibt es unsere KI-Schulungen.

Was im Betrieb tatsächlich trägt

Grundlage geben, statt Wissen abfragen. Ein Assistent, der seine Antworten aus Ihren freigegebenen Dokumenten zieht (Retrieval Augmented Generation), entzieht der Halluzination den Anlass. Diese Bauweise ist der Normalfall bei einem KI-Chatbot im Unternehmen und gehört in jedes Lastenheft.

Die Quelle mit ausgeben. Eine Antwort mit Verweis auf das Dokument, aus dem sie stammt, ist prüfbar. Eine Antwort ohne Verweis ist es nicht. Der Aufwand dafür fällt einmal bei der Einrichtung an.

Automatisch prüfen, wo es automatisch geht. Generierter Quellcode durchläuft die vorhandene Testsuite und die Sicherheitsprüfung wie jeder andere Code auch. Ein Paketname, den es nicht gibt, fällt dabei sofort auf; einer, den ein Angreifer eigens angelegt hat, nicht. Deshalb gehört die Herkunft jeder neuen Abhängigkeit dazu.

Menschlich freigeben, wo es Folgen hat. Eine Freigabe braucht einen Namen und einen Zeitpunkt vor der Wirkung. Wo beides fehlt, findet sie nicht statt, auch wenn sie in einer Richtlinie steht.

Sagen, dass eine KI antwortet. Ein erkennbar gekennzeichneter Assistent wird anders gelesen als eine Auskunft, die aus dem Nichts kommt. Für Systeme, die direkt mit Personen sprechen, verlangt der EU AI Act diese Kennzeichnung ohnehin.

Fazit

Ein Sprachmodell erzeugt Sprache und keine Wahrheit. Diese Eigenschaft lässt sich nicht wegkonfigurieren, und deshalb verschiebt sich die Frage von der Technik auf den Ablauf: Woher nimmt eine Antwort ihre Grundlage, wer sieht sie vor ihrer Wirkung, und was passiert, wenn sie falsch war? Die dritte Frage entscheidet darüber, wie groß der Schaden wird. Wo die eigene KI-Anwendung dabei steht, klärt eine Sicherheitsbetrachtung für KI-Systeme.

Häufige Fragen

Was bedeutet Misinformation bei einem Sprachmodell?

Misinformation ist eine Ausgabe eines Sprachmodells, die glaubwürdig klingt und trotzdem falsch ist. OWASP führt sie in der Fassung 2025 der Liste zu den häufigsten Schwachstellen in LLM-Anwendungen als Punkt LLM09 und nennt als Hauptursache die Halluzination: Das Modell füllt eine Lücke im gelernten Material mit einer plausiblen Formulierung, weil es Muster fortsetzt und keine Sachverhalte nachschlägt. Zur Schwachstelle wird das erst dadurch, dass niemand einer Antwort ansieht, auf welcher Grundlage sie steht.

Verhindert Retrieval Augmented Generation Halluzinationen?

Eine Antwort aus freigegebenen Dokumenten ist seltener frei erfunden als eine aus dem allgemeinen Modellwissen. OWASP führt die Anbindung geprüfter Quellen deshalb als erste Gegenmaßnahme, eine Garantie ist sie nicht. Zwei Restrisiken bleiben: Die Suche legt dem Modell das falsche Dokument vor, oder das richtige Dokument wird falsch zusammengefasst. Die Anbindung verschiebt die Frage damit von der Erfindung auf die Auswahl: Welche Unterlage hat das Modell überhaupt bekommen, und war sie die richtige?

Worin unterscheidet sich Misinformation von Improper Output Handling?

Bei der Misinformation ist der Inhalt der Antwort falsch. Bei der unsicheren Verarbeitung von Ausgaben (OWASP LLM05) ist der Inhalt womöglich richtig, und das nachgelagerte System behandelt ihn falsch, indem es ihn ungeprüft als Code oder als HTML weiterreicht. Die beiden Punkte treffen sich in der Praxis beim generierten Quellcode, der zugleich erfunden und gefährlich sein kann. Getrennt gehören sie trotzdem, weil die Gegenmaßnahmen an verschiedenen Stellen ansetzen: die eine bei der Grundlage der Antwort, die andere bei ihrer Weiterverarbeitung.

Welche KI-Ausgaben müssen im Betrieb gegengelesen werden?

Ausschlaggebend ist, was eine Ausgabe auslöst, und nicht, wie lang sie ist. Was das Haus verlässt, also ein Angebot oder eine Kundenantwort unter Ihrem Namen, braucht die Freigabe einer Person, die den Sachverhalt kennt. Was in ein System einfließt, etwa Quellcode oder Stammdaten, braucht eine maschinelle Prüfung, die den Fehler findet, bevor er wirkt. Für alles Übrige reicht eine Stichprobe. Diese Einteilung passt auf eine Seite und ist der Teil der Absicherung, der nichts kostet.

Zuletzt aktualisiert: