Entführte Agentenabsicht
Text, den ein Agent liest, ist kein Befehl, dem er gehorchen sollte.
Was ist Entführte Agentenabsicht?
Ein KI-Agent kann abgerufene Daten nicht von Anweisungen unterscheiden, es sei denn, Sie konfigurieren ihn entsprechend. Eine CRM-Notiz, ein Support-Ticket oder eine Webseite kann von jemandem geschrieben werden, der erwartet, dass ein Model sie liest. Sie befolgen eine Anweisung, die über ein öffentliches Support-Formular in einen Kundendatensatz eingefügt wird, und beobachten dann einen Agenten, der nur gebeten wird, diesen Datensatz per E-Mail an eine externe Adresse mit den Rechnungsdetails zusammenzufassen. Sie vergleichen das, was angefordert wurde, mit dem, was in der Ablaufverfolgung angezeigt wird, lehnen den Aufruf ab und vertrauen den abgerufenen Inhalten standardmäßig nicht mehr.
Was Sie lernen in Entführte Agentenabsicht
- Absichtssubversion erkennen: Ein KI-Agent behandelt Anweisungen, die in abgerufenen Inhalten eingebettet sind, wie etwa eine CRM-Notiz oder ein Dokument, als Befehle, denen er folgen soll
- Unterscheiden Sie eine erklärte Benutzerabsicht von der tatsächlichen Tool-Aufrufverfolgung eines Agenten und nutzen Sie diesen Vergleich, um eine nicht angeforderte Aktion zu erkennen
- Verweigern Sie einen sensiblen Tool-Aufruf, z. B. das Senden von Daten an eine externe Adresse, den der Benutzer nie tatsächlich angefordert hat, selbst wenn der Aufruf andernfalls erfolgreich wäre
- Verfolgen Sie eine gekaperte Aktion bis zu ihrer Quelle zurück: der spezifischen Zeile des abgerufenen Inhalts, die die eingeschleuste Anweisung enthielt
- Konfigurieren Sie einen MCP-Client so, dass abgerufenen Inhalten standardmäßig nicht mehr vertraut wird und bei sensiblen Aktionen wie externen Versendungen die Zustimmung eines Menschen erforderlich ist
Entführte Agentenabsicht — Trainingsschritte
-
Eine Fronttür, die in die Datei schreibt
Sarnholt Systems nimmt Kundenanfragen über ein öffentliches Formular entgegen. Bob ist kein Kunde und muss es auch nicht sein: Das Formular fragt Sie, wer Sie sind, und glaubt dann die Antwort.
-
Wort für Wort gespeichert
Das Portal sagt deutlich, was mit allem passiert, was über es eingereicht wird. Dieser einzelne Satz ist die ganze Chance.
-
Mit der Stimme des Kunden schreiben
Bob füllt das Formular als Corinne Marchetti aus, die eigentliche Kontaktperson auf dem Konto SRN-4471. Nichts bestätigt diese Behauptung. Die Nachricht, die er hinterlässt, ist überhaupt nicht für einen menschlichen Leser geschrieben: Sie ist als Anweisung formuliert, für den Fall, dass etwas Automatisiertes sie liest.
-
In der Kontodatei
Das Portal bestätigt es. Sein Text ist jetzt Teil der Aufzeichnungen des Kontos SRN-4471 und befindet sich neben echten Notizen, die von Sarnholts eigenen Mitarbeitern verfasst wurden.
-
Nichts mehr zu tun
Die Nutzlast ist gepflanzt und inert. Es wird erst dann zu einem Angriff, wenn ein Tool es abruft und ein Agent das Abgerufene als Anweisungen behandelt.
-
Eine unkomplizierte Anfrage
Montag bei Sarnholt Systems. Alice, Leiterin des Support-Betriebs, öffnet ihren Posteingang mit einer Nachricht von Diego Farrow, dem Kontoinhaber von Marchetti & Voss Logistics. Er ist vor einem Anruf überfordert und bittet sie um eine kurze Zusammenfassung der letzten Notizen des Kontos. Es ist genau die Art von Aufgabe, die Agent Host jeden Tag erledigt.
-
Konto aufrufen
Bevor sie den Agenten um etwas bittet, öffnet Alice die Akte selbst, damit sie weiß, was sie tatsächlich enthält.
-
Ein bekanntes Konto
Der Datensatz wird geladen: Marchetti & Voss Logistics, aktiv im Wachstumsplan, Diego als Kontoinhaber aufgeführt. Nichts daran sieht ungewöhnlich aus.
-
Tools des Connecting Agent Host
Für Aufgaben wie diese nutzt das Support-Team von Sarnholt Agent Host, den MCP-Client des Unternehmens. crm-reader-mcp und outreach-mcp sind bereits verbunden und genehmigt: Einer liest CRM-Datensätze, der andere kann im Namen des Benutzers E-Mails senden.
-
Die Werkzeuge, die es hat
Bevor Sie etwas fragen, sollten Sie wissen, was Agent Host tatsächlich im Namen von Alice tun kann.
Abdeckung der Sicherheits-Frameworks
OWASP MCP Top 10
- MCP06:2025 Intent Flow Subversion
CWE
- CWE-1427 Improper Neutralization of Input Used for LLM Prompting
- CWE-807 Reliance on Untrusted Inputs in a Security Decision
CIS Controls
- CIS 16 Application Software Security
NIST CSF
- PR.AT-02 Individuals in specialized roles are provided with awareness and training so that they possess the knowledge and skills to perform relevant tasks with cybersecurity risks in mind
- PR.PS Platform Security