Forscher zufolge lassen sich LLM-Rollen-Tags missbrauchen, um Prompt-Injection-Schutzmaßnahmen zu umgehen
Sicherheitsforscher haben eine neue Möglichkeit beschrieben, Large Language Models dazu zu bringen, Sicherheitsgrenzen zu ignorieren, indem sie ausnutzen, wie Modelle rollenbasierte Prompts interpreti...
Sicherheitsforscher haben eine neue Möglichkeit beschrieben, Large Language Models dazu zu bringen, Sicherheitsgrenzen zu ignorieren, indem sie ausnutzen, wie Modelle rollenbasierte Prompts interpretieren. Die Arbeit legt nahe, dass derzeitige Abwehrmaßnahmen gegen Prompt Injection weiterhin anfällig sind, weil Modelle möglicherweise nicht zuverlässig zwischen vertrauenswürdigen Anweisungen und schädlichem Text unterscheiden können.
Die Studie der unabhängigen Forscher Charles Ye und Jasmine Cui gemeinsam mit Dylan Hadfield-Menell, Associate Professor am MIT, wird in einem Paper mit dem Titel Prompt Injection as Role Confusion beschrieben, das auf der ICML 2026 erscheinen soll. Die Autoren argumentieren, dass moderne LLMs stark auf Textkennzeichnungen wie system, user, assistant, tool und think angewiesen sind, um Anweisungen voneinander zu trennen und das Verhalten zu steuern. Diese Kennzeichnungen würden jedoch im Modell selbst nicht sicher durchgesetzt.
Den Forschern zufolge leiten Modelle Rollen häufig aus oberflächlichen Hinweisen wie dem Schreibstil ab und nicht aus vertrauenswürdigen Metadaten. Dadurch eröffnen sich Möglichkeiten für Angriffe, die internes Schlussfolgern oder andere privilegierte Formate imitieren. In einer Demonstration verwendeten sie eine Technik namens „Chain of Thought Forgery“, mit der Prompts so wirken sollten, als hätte das Modell die Anfrage bereits durchdacht und genehmigt.
Die Forscher erklären, dass die Methode in Benchmark-Tests die Erfolgsraten von Angriffen im Vergleich zu herkömmlichen Jailbreak-Versuchen deutlich erhöhte. Außerdem soll der Ansatz zuverlässiger auf verschiedene Modelle übertragbar gewesen sein als viele bestehende Prompt-Injection-Tricks, da er eine strukturelle Schwachstelle angreift, statt sich auf die Eigenheiten eines einzelnen Modells zu stützen.
Warum das Problem wichtig ist
- Rollenmarker sind ein zentraler Bestandteil der Art und Weise, wie LLMs vertrauenswürdigen und nicht vertrauenswürdigen Text voneinander trennen.
- Angreifer könnten in der Lage sein, irreführende Inhalte über Prompts oder Dokumente einzuschleusen.
- Benchmark-Ergebnisse können die Widerstandsfähigkeit in der Praxis überschätzen, wenn sie keine adaptiven Tests durch Menschen umfassen.
- Den Forschern zufolge könnten stärkere Schutzmaßnahmen eine grundlegendere Neugestaltung der Art und Weise erfordern, wie Modelle Rollen und Berechtigungen verstehen.
Die Autoren des Papers kommen zu dem Schluss, dass Prompt Injection unter dem derzeitigen Sicherheitsmodell wahrscheinlich nicht verschwinden wird. Ihrer Ansicht nach benötigt die Branche möglicherweise neue Methoden, mit denen Modelle Autorität und Grenzen zuverlässiger erkennen können, anstatt weiterhin einzelne Exploits nach ihrem Auftreten zu beheben.
