System Prompt Leakage bei LLMs: Was nicht in den System Prompt gehört
OWASP LLM07: System Prompt Leakage
System Prompt Leakage bezeichnet den Fall, dass der System Prompt (die Systemanweisung) einer KI-Anwendung bei ihren Nutzern landet. OWASP führt diesen Punkt seit der Fassung 2025 und stellt ihm einen unbequemen Satz voran: Ein System Prompt ist kein Geheimnis und taugt nicht als Sicherheitskontrolle. Der Schaden entsteht durch das, was jemand hineingeschrieben hat, und nicht durch das Auslesen.
Ein Punkt ohne Vorgänger
In der Liste von 2023/24 kam dieser Fall nicht vor. LLM07 System Prompt Leakage ist mit der Überarbeitung von 2025 neu dazugekommen, gemeinsam mit dem Punkt zu Vector Stores.
Die Kernaussage ist ungewöhnlich direkt formuliert, und sie dreht die naheliegende Reaktion um. Wer erfährt, dass Nutzer die eigene Anweisung auslesen konnten, will zuerst das Auslesen verhindern. OWASP hält dagegen, dass die Offenlegung für sich genommen kein Risiko ist. Das Risiko liegt in den Elementen, die dort stehen, und die stehen dort auch an einem Tag, an dem niemand fragt. Ein Zugangsschlüssel im System Prompt ist ein Zugangsschlüssel an der falschen Stelle, ganz gleich, wer ihn zu sehen bekommt.
Was in einem System Prompt aufläuft
OWASP nennt vier Arten von Inhalten, die dort regelmäßig landen.
- Technische Angaben zur Umgebung. Ein Zugangsschlüssel steht dort im schlimmsten Fall im Klartext. Auch das Kleinere wirkt: Die Art der angebundenen Datenbank erspart einem Angreifer das Raten und macht aus einem breiten Versuch einen gezielten.
- Interne Regeln und Schwellen. Ein Assistent in der Finanzbranche führt Betragsgrenzen oder Bewilligungsschwellen mit, damit er sie einhält. Wer sie kennt, weiß, wie er unter ihnen bleibt.
- Die Kriterien der eigenen Filter. Anweisungen der Form „In diesem Fall antworte ablehnend“ beschreiben die Abwehr. Sie zeigen an, welcher Fall sie auslöst und welcher an ihr vorbeiläuft.
- Rollen und Berechtigungen. Steht in der Anweisung, welche Nutzergruppe was darf, steht dort auch, als was sich jemand ausgeben müsste.
Der gemeinsame Nenner: Das Modell braucht keine dieser vier Angaben, um zu antworten.
Wie ein System Prompt nach draußen gelangt
Der bekannte Weg ist die Prompt Injection. Eine passend gebaute Eingabe bringt das Modell dazu, seine Anweisung wiederzugeben oder zu umschreiben. Ein zweiter Weg kommt ohne Angriff aus: Anweisung und Anfrage stehen im selben Kontext, und eine Frage, die nah genug daran vorbeiführt, holt Teile davon in die Antwort. Beides lässt sich erschweren, keines lässt sich ausschließen. Das ist der sachliche Grund hinter der Empfehlung von OWASP: Ein System Prompt trägt am besten nichts, dessen Verlust wehtut.
Wohin die Inhalte stattdessen gehören
Vertrauliches in die Infrastruktur. Schlüssel in einen Geheimnisspeicher, Namen und Endpunkte in die Konfiguration der Anwendung. Der System Prompt beschreibt, wie das Modell antworten soll, und braucht dafür keinen Zugang.
Eine Grenze in das System, das sie durchsetzt. Ein Betrag, ab dem ein Vorgang zu prüfen ist, gehört in die Anwendung, die den Vorgang auslöst. Im System Prompt ist er eine Angabe über die Anwendung und noch keine Eigenschaft von ihr. Welche Handlungen eine KI-Anwendung überhaupt auslösen darf und woran ihre Rechte hängen, behandelt der Punkt Excessive Agency (OWASP LLM06).
Guardrails neben das Modell. Ob eine Antwort den Vorgaben entspricht, prüft ein eigenes System auf der Ausgabe. Die Anweisung, bestimmte Inhalte zu unterlassen, ist von der Prüfung auf diese Inhalte verschieden, und nur die zweite lässt sich nachweisen.
Was danach im System Prompt übrig bleibt, ist Arbeitsanweisung, etwa Tonfall und Aufbau der Antwort. Wird sie ausgelesen, erfährt der Leser, wie die Anwendung gedacht ist. Mehr nicht.
Zwei Fälle, die OWASP beschreibt
Im ersten stehen Zugangsdaten in der Anweisung. Wer sie ausliest, verwendet sie außerhalb der Anwendung weiter, und das angebundene System merkt davon nichts, weil die Anmeldung gültig ist.
Im zweiten liest ein Angreifer die Schutzregeln heraus und formuliert daraufhin eine Prompt Injection, die an ihnen vorbeiführt; am Ende dieses Szenarios steht die Ausführung fremden Programmcodes. Dieser Fall zeigt, wozu ein ausgelesener System Prompt dient. Er ist Vorarbeit für den nächsten Schritt.
Fazit
Die Prüfung zu diesem Punkt braucht kein Werkzeug. Man öffnet den eigenen System Prompt und liest ihn so, als stünde er auf der Startseite. Jede Zeile, die dabei unangenehm auffällt, gehört an eine andere Stelle der Anwendung. Der Rest darf gelesen werden, denn geschützt hat er ohnehin nie.