we-make.ai

Sensitive Information Disclosure bei LLMs: Datenabfluss verhindern

OWASP LLM02: Sensitive Information Disclosure

Sensitive Information Disclosure bezeichnet die unbeabsichtigte Offenlegung vertraulicher Daten durch ein Sprachmodell. Modelle können sensible Trainingsinhalte, personenbezogene Daten oder Geschäftsgeheimnisse in ihren Antworten preisgeben, oft ausgelöst über entsprechend formulierte Prompts. Schutz bieten Datenminimierung, die Bereinigung der Trainingsdaten, Ausgabefilter und strikte Zugriffskontrollen.

Vom sechsten auf den zweiten Platz

Der Name dieses Punktes hat sich mit der Überarbeitung von 2025 nicht geändert, seine Nummer schon: Aus LLM06 wurde LLM02 Sensitive Information Disclosure. Warum OWASP den Punkt vorgezogen hat, begründet die Liste nicht. Auffällig wird er dort, wo ein Modell an die eigenen Ablagen gehängt wird: Je mehr Betriebe das tun, desto häufiger steht am Ende einer Antwort etwas, das dort nicht stehen sollte.

Welche Daten große Sprachmodelle preisgeben können

Die Aufzählung von OWASP ist breiter, als der Begriff „personenbezogene Daten“ vermuten lässt. Sie gilt für jede Anwendung, die auf große Sprachmodelle (LLMs) aufsetzt, und sie beschreibt nicht nur Personendaten. Sie umfasst Gesundheits- und Finanzdaten, Zugangsdaten, Vertragsunterlagen und juristische Schriftsätze, dazu die Betriebsgeheimnisse auf der Seite des Anbieters: eigene Verfahren, Trainingsmethoden und der Quellcode eines Modells, das nicht offenliegt.

Für einen Mittelbetrieb ist die zweite Hälfte dieser Liste die unangenehmere. Personenbezogene Daten sind in der Regel bekannt und irgendwo klassifiziert. Die Kalkulationslogik aus einem alten Angebotsdokument ist es nicht, und sie liegt trotzdem in derselben Ablage, auf die der Assistent zugreift.

Drei Wege nach draußen

Ohne Zutun. Die Antwort enthält Daten eines anderen Nutzers, weil die Eingaben vor der Verarbeitung nicht bereinigt wurden oder weil ein gemeinsamer Sitzungsspeicher zwei Vorgänge vermischt. Niemand hat angegriffen, und niemand merkt es, solange der Empfänger nicht nachfragt.

Über eine gezielte Eingabe. Ein Angreifer formuliert seine Anfrage so, dass die Filter nicht greifen. Das ist die Prompt Injection in ihrer stillsten Form: Das Ziel ist keine fremde Handlung, sondern eine Auskunft.

Aus dem Training. Was einmal in einem Trainings- oder Finetuning-Datensatz gelandet ist, lässt sich nicht zurückholen. Modelle geben solche Inhalte unter passenden Bedingungen wieder aus, und die passende Bedingung kennt vorher niemand.

Was im Betrieb hilft

Der wirksamste Schritt kostet keine Technik: festlegen, welche Daten ein Modell überhaupt zu sehen bekommt. Alles, was nicht in den Index geht, kann auch nicht herausfallen. Danach kommen die technischen Maßnahmen, und sie greifen in dieser Reihenfolge.

Bereinigen, bevor die Daten hineingehen. Namen, Nummern und Zugangsdaten aus Trainings- und Indexdaten entfernen oder durch Platzhalter ersetzen. Was dabei verloren geht, ist selten das, was die Antwort braucht.

Berechtigungen im Speicher abbilden, nicht im Prompt. Ein Assistent, der die ganze Ablage indexiert und beim Antworten „nur das Erlaubte“ zeigen soll, hat die Trennung an der falschen Stelle. Sie gehört in den Vector Store und in die Suche davor, damit ein Treffer erst gar nicht entsteht.

Die Anbindung nach außen begrenzen. Jede zusätzliche Datenquelle und jedes zusätzliche Werkzeug vergrößert die Menge dessen, was in eine Antwort geraten kann. Welche Vollmachten ein Werkzeug dabei bekommt, behandelt der Punkt Excessive Agency (OWASP LLM06).

Die Nutzer einweihen. Was in einen öffentlichen Assistenten eingegeben wird, ist aus der Hand gegeben. Eine kurze, verbindliche Regel dazu verhindert mehr Abfluss als jeder Ausgabefilter.

Wo die Vertraulichkeit die Anwendung trägt, bleibt der Betrieb im eigenen Haus die klarste Antwort. Eine lokale KI-Infrastruktur macht die Frage, was ein fremder Anbieter mit den Eingaben tut, gegenstandslos. Die Zugriffstrennung im Inneren ersetzt sie nicht.

Fazit

Die Offenlegung sensibler Daten ist der Punkt der Liste, bei dem das Modell nichts falsch macht. Es gibt weiter, was es bekommen hat, an den, der gefragt hat. Wer den Zugriff vorher ordnet, hat den Fall im Wesentlichen erledigt; wer ihn nachträglich filtern will, prüft auf Verdacht gegen eine Menge, die er nicht kennt.

Häufige Fragen

Was ist Sensitive Information Disclosure bei Sprachmodellen?

Vertrauliche Angaben verlassen das Unternehmen über die Antwort eines Sprachmodells. Sie stammen aus dem Training, aus einer anderen Sitzung oder aus der Ablage, an die das Modell angebunden ist, und sie landen bei jemandem, der sie nicht sehen dürfte. OWASP zählt diesen Fall in der Überarbeitung von 2025 als zweiten seiner zehn Punkte zu Anwendungen mit Sprachmodellen, davor stand er an sechster Stelle.

Welche Risiken entstehen dadurch für Unternehmen?

Werden personenbezogene oder anderweitig sensible Daten offengelegt, drohen Verstöße gegen die DSGVO und der Verlust von Betriebsgeheimnissen. Besonders kritisch ist das, wenn ein öffentlich zugänglicher Assistent auf interne Datenquellen zugreift.

Wie minimiert man das Risiko der Offenlegung sensibler Daten?

Das Risiko sinkt mit Datenbereinigung und -klassifizierung, strikten Zugriffskonzepten, einer klaren Trennung von Berechtigungen und, wo möglich, mit der Verarbeitung auf einer lokalen, DSGVO-konformen KI-Infrastruktur, bei der die Daten das Unternehmen nicht verlassen. Mehr dazu unter Datenschutz & KI-Sicherheit.

Zuletzt aktualisiert: