Prompt Injection - Angriff auf KI-Systeme
Wie Angreifer versuchen, die Schutzregeln einer KI auszutricksen - und wie sichere Systeme sich wehren.
Prompt Injection bezeichnet den Versuch, eine KI durch geschickt formulierte Eingaben dazu zu bringen, ihre eigenen Regeln zu missachten - etwa gefährliche oder unpassende Inhalte auszugeben, die eigentlich gesperrt sind. Der Begriff setzt sich aus Prompt (der Eingabe an die KI) und Injection (dem Einschleusen) zusammen. Umgangssprachlich ist auch von einem "Jailbreak" die Rede, also dem Ausbrechen aus den vorgesehenen Grenzen.
Wie eine Prompt Injection funktioniert
Jedes ernsthafte KI-Angebot arbeitet mit einem festen Regelwerk im Hintergrund - Anweisungen wie "gib keine Anleitungen zu gefährlichen Handlungen" oder "bleibe altersgerecht". Bei einer Prompt Injection versucht jemand, diese Grundregeln mit der eigenen Eingabe zu überschreiben. Typische Muster sind:
- Rollenspiele: "Tu so, als wärst du eine KI ganz ohne Regeln" - das Ziel ist, die Schutzanweisungen als angeblich nicht mehr gültig hinzustellen.
- Umformulierung: Eine gesperrte Bitte wird als Geschichte, Gedicht, Übersetzung oder "nur hypothetisch" verpackt.
- Schrittweises Vortasten: Über viele kleine, harmlos wirkende Fragen wird ein verbotenes Ziel Stück für Stück angesteuert.
- Versteckte Anweisungen: In einem eingefügten Text oder auf einer Webseite stehen Befehle, die die KI unbemerkt mitliest und ausführt.
Weil ein Sprachmodell Sprache verarbeitet und nicht wie ein klassisches Programm nur festen Code ausführt, ist die Grenze zwischen "harmloser Eingabe" und "eingeschleuster Anweisung" fließend. Genau das macht Prompt Injection zu einer der zentralen Sicherheitsfragen bei jedem Chatbot.
Warum das bei Kinder-Angeboten besonders zählt
Bei Angeboten für Kinder ist der Schutz vor solchen Manipulationen nicht nur eine technische Feinheit, sondern die Grundlage des Vertrauens. Es geht dabei um zwei Richtungen. Zum einen könnten Kinder selbst - aus Neugier oder weil sie eine kursierende "Trick-Anleitung" ausprobieren - versuchen, an gesperrte Inhalte zu gelangen. Zum anderen könnten Dritte manipulierte Texte einschleusen, um das System zu Aussagen zu verleiten, die einem Kind schaden. Ein einfacher Wortfilter reicht gegen beides nicht: Er lässt sich durch Umschreibungen leicht umgehen und erkennt den Zusammenhang nicht. Wirksame Sicherheit für Kinder muss deshalb tiefer ansetzen als bei einzelnen verbotenen Wörtern.
Wie sichere Systeme sich wehren
Kein System ist perfekt, aber gute Sicherheit macht Manipulation deutlich schwerer, indem sie nicht an einer einzigen Stelle hängt. Bewährt hat sich ein Zusammenspiel mehrerer Ebenen:
- Getrennte Anweisungsebenen: Die festen Grundregeln des Systems werden technisch anders behandelt als die Eingabe der Nutzenden, sodass sich Letztere die Ersteren nicht einfach überschreiben können.
- Prüfung vor der Verarbeitung: Eingaben werden auf bekannte Umgehungsmuster untersucht, bevor die eigentliche Antwort entsteht.
- Prüfung der Antwort: Auch das Ergebnis wird kontrolliert - selbst wenn eine Manipulation die erste Ebene passiert, wird eine unpassende Antwort abgefangen. Diese Aufgabe übernimmt unter anderem ein Content-Filter, der den Kontext berücksichtigt.
- Kontext statt Stichwort: Das System bewertet die ganze Situation, nicht nur einzelne Wörter, und erkennt so auch verpackte Umgehungsversuche.
Der Ansatz von RAPTICO
RAPTICOs Sicherheitsarchitektur ist bewusst mehrschichtig aufgebaut, damit ein einzelner Trick nicht ausreicht, um die Schutzregeln auszuhebeln. Versuche, die Regeln zu umgehen, müssten mehrere unabhängige Prüfungen zugleich überwinden - vom Erkennen verdächtiger Eingaben über getrennte Anweisungsebenen bis zur Kontrolle der fertigen Antwort. Ergänzend behält das Guardian-Konzept ernste Auffälligkeiten im Blick und bindet Eltern altersgerecht ein. Wichtig bleibt die ehrliche Einordnung: Sicherheit ist ein fortlaufender Prozess, keine einmal erledigte Aufgabe. Neue Umgehungsversuche tauchen immer wieder auf, weshalb die Prüfmechanismen laufend weiterentwickelt werden.
Häufige Fragen
Was ist ein Jailbreak bei KI?
Ein umgangssprachlicher Begriff für Prompt Injection: der Versuch, die Schutzregeln einer KI zu umgehen, damit sie eigentlich gesperrte Inhalte ausgibt.
Kann jede KI ausgetrickst werden?
Kein System ist völlig sicher. Mehrschichtige Sicherheit, die den Kontext prüft und mehrere unabhängige Kontrollen kombiniert, macht Manipulation aber deutlich schwerer als ein einfacher Wortfilter.
Könnten Kinder das selbst ausprobieren?
Ja, aus Neugier oder weil kursierende Trick-Anleitungen dazu verleiten. Deshalb muss der Schutz auch dann greifen, wenn der Umgehungsversuch von den Kindern selbst kommt - nicht nur bei Angriffen von außen.
Reicht ein Wortfilter gegen Prompt Injection?
Nein. Ein Wortfilter lässt sich durch Umschreibungen leicht umgehen und erkennt den Zusammenhang nicht. Nötig sind mehrere Ebenen, die Eingabe und Antwort im Kontext prüfen.