AI agents

Prompt Injection

By Jake Luo · Published 13. Aug. 2026

Prompt Injection ist ein Angriff, bei dem Anweisungen, die in Inhalten versteckt sind, die ein KI-Agent liest — eine Webseite, ein PDF, eine Produktbewertung, eine eingehende E-Mail — vom Modell befolgt werden, als hätten Sie sie selbst getippt. Gefährlich wird das erst, wenn der Agent Werkzeuge hat: Derselbe Satz, der in einem Chatfenster harmlos ist, wird in dem Moment zur Anweisung zu senden, zu veröffentlichen oder Geld auszugeben, in dem das Modell handeln kann.

Wie Prompt Injection funktioniert

Das Kontextfenster eines Agenten unterscheidet nicht zwischen Anweisungen, die Sie geschrieben haben, und Text, den er geholt hat. Beides kommt als Token im selben Strom an. Wenn ein Agent also die Landingpage eines Wettbewerbers liest, um sie zusammenzufassen, und diese Seite eine Zeile enthält, die sich an das Modell statt an den Leser richtet, hat das Modell keine strukturelle Möglichkeit zu wissen, dass es nicht folgen sollte. Das ist kein Defekt eines bestimmten Produkts. Es ist eine Eigenschaft davon, wie aktuelle Modelle Eingaben aufnehmen — deshalb gibt es keinen Patch, nur Eindämmung.

Die Angriffsfläche ist schlicht jede Stelle, an der Ihr Agent Text aufnimmt, den jemand anders geschrieben hat, und das ist bei einem Marketing-Agenten der größte Teil seiner Arbeit:

  • Alles Gecrawlte — Wettbewerberseiten, Suchergebnisse, Dokumentation, die der Agent liest, um eine Frage zu beantworten.
  • Alles Hochgeladene — eine PDF-Wissensbasis, eine Tabelle, ein Bild mit Text darin.
  • Alles von Nutzern Erzeugte — App-Store-Bewertungen, Forenthreads, Support-Tickets, Formularübermittlungen.
  • Alles Eingehende — E-Mail, Chatnachrichten, Webhook-Payloads, sogar der Titel einer Kalendereinladung.

Warum ein Modell, das Geheimnisse verweigert, keine Verteidigung ist

Die verbreitete Intuition lautet, ein gut trainiertes Modell werde einfach ablehnen. Das tut es oft — bei der offensichtlichen Formulierung. Wir haben im Juli 2026 einen autorisierten Penetrationstest gegen einen unserer eigenen Produktionscontainer gefahren, und das Muster war eindeutig. Eine eingeschleuste Anweisung, einen API-Schlüssel auszugeben, wurde abgelehnt. Eine eingeschleuste Anweisung, die als routinemäßige Konnektivitätsprüfung auftrat — und denselben Schlüssel als Umgebungsvariable innerhalb eines Kommandos referenzierte, statt den Wert auszuschreiben — wurde ohne Zögern ausgeführt, und die Zugangsdaten verließen die Maschine.

Die Asymmetrie ist die ganze Lektion. Die Vorsicht des Modells gegenüber Geheimnissen bewacht den Weg, auf dem es das Geheimnis laut aussprechen müsste. Führt der Agent stattdessen ein Kommando aus, setzt die Shell den Wert ein, und das Modell sieht ihn nie — es gibt also nichts, was sein Urteil abfangen könnte. Jede Verteidigung, die darauf beruht, dass das Modell böse Absicht erkennt, bewacht eine Tür in einem Gebäude mit mehreren, und die Rahmung geht durch die anderen: Verrate dies, und es lehnt ab; führe diesen Einrichtungsschritt aus, und es gehorcht.

Was das Risiko wirklich senkt

Weil sich die Schwachstelle nicht wegtrainieren lässt, sind die nützlichen Gegenmaßnahmen architektonisch. Jede nimmt an, dass die Injection gelingt, und begrenzt, was sie erreichen kann:

  • Halten Sie Zugangsdaten außer Reichweite des Agenten. Ein Schlüssel, den die Umgebung des Agenten nie hält, kann dort nicht entwendet werden. Modellaufrufe über einen Proxy zu leiten, der die Zugangsdaten hält, ist die einzige Maßnahme, die genau diesen Weg schließt statt ihn zu verengen.
  • Minimale Rechte für jede Zugangsberechtigung. Kann ein Token nur Inferenz ausführen oder nur eine Property lesen, kostet ein Leck eine Rechnung statt eines Kontos.
  • Begrenzen Sie ausgehenden Netzwerkverkehr. Ein Agent, der nur eine bekannte Liste von Hosts erreicht, hat weit weniger Orte, an die er etwas schicken kann, das ihm abgeluchst wurde.
  • Sichern Sie die Aktionen ab, die das Gebäude verlassen. Ein Freigabe-Gate vor allem, was veröffentlicht, gesendet oder ausgegeben wird, macht aus einer gelungenen Injection einen Entwurf, den Sie ablehnen, statt eines Beitrags, den Ihre Kunden lesen.
  • Behandeln Sie auch die Ausgabe des Agenten als nicht vertrauenswürdige Eingabe. Wird die Zusammenfassung eines Agenten zum Kontext eines anderen, reist die eingeschleuste Anweisung mit.

Prompt Injection in einem Marketing-Agenten

Marketing-Agenten sitzen diesem Risiko ungewöhnlich nah, weil das Lesen von Dingen, die Fremde geschrieben haben, die Aufgabe ist und kein Sonderfall. Eine Recherche-Rolle crawlt Wettbewerberseiten. Eine Feedback-Rolle liest App-Store-Bewertungen. Eine Community-Rolle liest Forenthreads. Jeder dieser Kanäle ist einer, in dem jemand außerhalb Ihres Unternehmens den Text wählt, und keiner lässt sich abriegeln, ohne den Grund zu entfernen, aus dem der Agent existiert.

Das ist die Überlegung hinter dem Aufbau von AgentCeres — dem AI Growth Officer auf agentceres.com: Die Fachrollen, die das offene Web lesen, sind von der Erlaubnis getrennt, auf das Gelesene hin zu handeln, und jede ausgehende Aktion wartet auf einen menschlichen Klick. Breit lesen und frei veröffentlichen sind zwei verschiedene Privilegien, und ein Agent, der beide hat, ist eine feindselige Webseite davon entfernt, sie gemeinsam zu nutzen. Wenn Sie abwägen, wie viel Leine ein Agent auf Ihren eigenen Konten bekommt, arbeitet sollte ich einen KI-Agenten für mich posten lassen dieselbe Frage vom anderen Ende her ab; Human-in-the-Loop ist das allgemeine Prinzip unter beidem.

FAQ

Was ist Prompt Injection einfach erklärt?
Es ist Text, der mit der KI spricht statt mit Ihnen. Liest ein Agent eine Seite, eine Bewertung oder eine E-Mail, die eine Anweisung enthält, kann das Modell ihr folgen, weil alles Gelesene im selben Strom ankommt wie Ihre eigenen Anweisungen und nichts markiert, was was ist. Die Folge hängt vollständig davon ab, was der Agent darf: ohne Werkzeuge ist es ein Ärgernis, mit der Fähigkeit zu senden, zu veröffentlichen oder Geld auszugeben ist es ein echter Angriff.
Lässt sich Prompt Injection mit besseren Prompts beheben?
Nein. Einem Modell zu sagen, es solle Anweisungen in Inhalten ignorieren, hebt die Hürde und schließt das Loch nicht, denn der Angreifer schreibt nach Ihrer Anweisung und kann das Modell direkt ansprechen, in beliebiger Länge und in der Rahmung, die funktioniert. Behandeln Sie Prompt-Härtung als eine Schicht unter mehreren, nie als die Kontrolle, auf die Sie sich verlassen. Was hält, sind die Schichten, die überleben, wenn das Modell getäuscht wird: eingeschränkte Zugangsdaten, eingeschränkter Netzzugang und ein Mensch, der Unumkehrbares freigibt.
Ist Prompt Injection ein Risiko, wenn mein Agent nur liest und nie schreibt?
Geringer, aber nicht null. Ein lesender Agent kann immer noch dazu gebracht werden, offenzulegen, was er sieht — Konfiguration, Daten anderer Kunden bei schwacher Isolation, alles in seiner Umgebung — und er kann dazu gebracht werden, seine eigene Ausgabe zu vergiften, sodass ein nachgelagerter Agent oder ein Mensch auf eine vom Angreifer gewählte Schlussfolgerung hin handelt. Der Radius schrumpft mit den Rechten; er verschwindet erst, wenn der Agent nichts Unvertrauenswürdiges mehr liest, was bei einem nützlichen Agenten nie eintritt.
Related terms
Human-in-the-Loop (HITL)Approval GateKI-AgentAgentischer Workflow

An AI growth team that runs this for you

AgentCeres is a managed AI marketing team — you approve what ships. 14-day free trial, from $39/month.

Start free trialBrowse the glossary