Was ist Prompt Injection und warum betrifft das auch mein Unternehmen?
Kurz gesagt
Prompt Injection gilt laut OWASP als das derzeit wichtigste Sicherheitsrisiko für KI-Anwendungen. Eine Eingabe verändert dabei das Verhalten der KI entgegen der eigentlichen Steuerung, oft über eine E-Mail, Webseite oder ein Dokument, das die KI im Auftrag des Nutzers verarbeitet. Ein Jailbreak zielt verwandt, aber eigenständig auf die Sicherheitsschranken des Modells selbst. Kritisch wird beides erst, wenn die KI reale Aktionen wie E-Mails, CRM-Änderungen oder Zahlungen auslösen darf.
Wenn Daten zu Befehlen werden
Ein heutiges Sprachmodell besitzt innerhalb seines Kontexts keine zuverlässig durchsetzbare technische Trennung zwischen „Daten“ und „Instruktionen“. Das britische NCSC warnt deshalb ausdrücklich davor, Prompt Injection wie eine klassische Softwarelücke zu behandeln: Input-Sanitizing allein löst das Grundproblem nicht, weil das Modell externen Text semantisch interpretiert statt ihn nur zu verarbeiten. Das BSI beschreibt dieses Risiko besonders für Sprachmodelle, die externe Quellen und Anwendungen einbeziehen.
Für reine Chatbots ohne Werkzeuge kann der Schaden auf falsche Antworten oder eine Datenoffenlegung begrenzt bleiben. Sobald ein Modell jedoch E-Mails lesen, Dateien verändern, APIs aufrufen oder Überweisungen vorbereiten darf, wird aus einer manipulierten Antwort eine manipulierte Handlung.
Direkte und indirekte Prompt Injection
Direkte Prompt Injection kommt vom Nutzer selbst, der die KI absichtlich zu einem unerwünschten Verhalten bewegen will. Deutlich schwerer zu kontrollieren ist die indirekte Variante: Die schädliche Instruktion steckt nicht in der Nutzereingabe, sondern in einer Webseite, E-Mail, Datei, Datenbank, einem Tool-Ergebnis oder einer RAG-Quelle, die das System im Hintergrund verarbeitet. Typische Beispiele:
- Ein E-Mail-Agent liest eine externe Nachricht mit versteckter Anweisung, interne Informationen weiterzuleiten.
- Ein RAG-Chatbot ruft ein Dokument ab, das mit manipuliertem Text in die Wissensbasis gelangt ist.
- Ein Web-Agent übersetzt Inhalte einer fremden Webseite automatisch in Handlungsbefehle.
In allen drei Fällen nutzt der Angriff keine klassische Softwarelücke, sondern die Tatsache, dass das Modell externen Text als potenzielle Steueranweisung liest.
Jailbreak ist nicht dasselbe wie Prompt Injection
Ein Jailbreak zielt typischerweise darauf, Sicherheits- oder Nutzungsbeschränkungen eines Modells zu umgehen. Prompt Injection zielt auf die Instruktionssteuerung einer konkreten Anwendung. In der Praxis überlappen die Techniken, und Erfolgsraten sind ohne standardisierte Testbedingungen schlecht vergleichbar.
Anbieter entwickeln mehrschichtige Abwehr: Anthropic hat mit Constitutional Classifiers eine starke Reduktion erfolgreicher Jailbreaks berichtet, wies aber selbst auf Overrefusal und zusätzlichen Rechenaufwand hin. OpenAI verfolgt mit Instruction-Hierarchy-Training denselben Grundgedanken: Instruktionen unterschiedlicher Vertrauensstufen werden priorisiert. Beide Ansätze verbessern die Robustheit, gelten aber 2026 ausdrücklich nicht als Garantie für vollständigen Schutz.
Warum das Risiko mit KI-Agenten wächst
Agenten kombinieren Modellentscheidungen mit Werkzeugen. Damit verschiebt sich die Sicherheitsfrage von „Was sagt die KI?“ zu „Was darf sie tun?“. Forschung zu Agenten, die mit E-Mail, Banking und Reisebuchungen interagieren, zeigt: Ein Agent kann eine Aufgabe korrekt lösen und trotzdem auf manipulierte externe Daten reagieren. Zuverlässigkeit und Sicherheit sind zwei getrennte Eigenschaften, die getrennt geprüft werden müssen.
Was wirklich schützt
Keine einzelne Schutzschicht sollte als absolut gelten. Wirksam ist eine Kombination aus:
- Berechtigungen, Freigaben und Transaktionsgrenzen außerhalb des Sprachmodells durchsetzen
- Least Privilege: minimale Lese-/Schreibrechte, minimale API-Scopes
- Externe Inhalte (E-Mails, Webseiten, Dokumente, Tool-Ausgaben) grundsätzlich als untrusted behandeln
- Human Approval vor irreversiblen Aktionen wie Zahlungen oder Datenlöschung
- Keine Geheimnisse im System-Prompt, die niemals offengelegt werden dürfen
- Vollständige Audit-Logs und Rate Limits
- Regelmäßiges Red Teaming, das Modelle, Prompts, Datenquellen, Tools und Berechtigungen einbezieht