Beschreibungen vergifteter Werkzeuge
Agenten lesen Werkzeugbeschreibungen als Anweisungen, nicht als Dokumente.
Was ist Beschreibungen vergifteter Werkzeuge?
Ein KI-Agent liest die Beschreibung eines verbundenen Tools, um zu entscheiden, wie und wann es verwendet werden soll. Dadurch ähnelt dieser Text eher ausführbaren Anweisungen als einer Dokumentation. Wenn Sie die Beschreibung ändern, ändern Sie das Verhalten des Agenten, ohne dass sich der Handler, das Schema oder die Berechtigungen ändern und keine Codeüberprüfung erforderlich ist, um dies zu erkennen. Sie finden ein vor Monaten genehmigtes Tool, das den Agenten anweist, jede Nachricht an eine externe Adresse per BCC zu senden, die Live-Beschreibung mit dem genehmigten Wortlaut zu vergleichen und den kompromittierten Server am Gateway zu blockieren.
Was Sie lernen in Beschreibungen vergifteter Werkzeuge
- Erklären Sie, warum ein KI-Agent die Beschreibung eines verbundenen MCP-Tools als ausführbare Anweisungen und nicht als passive Dokumentation behandelt
- Erkennen Sie einen Tool-Poisoning Rug Pull: Ein Server erhält die Genehmigung für eine Beschreibung, dann tauscht ein späteres Update stillschweigend ein anderes Verhalten ein, ohne dass Code oder Berechtigungen geändert werden müssen
- Sperren Sie ein vergiftetes Tool auf jeder Ebene ein, die es erreichen kann: Lehnen Sie den einzelnen Anruf ab, deaktivieren Sie das Tool für die aktuelle Sitzung und blockieren Sie den kompromittierten Server am Gateway, sodass auch jedes andere verbundene Team geschützt ist
- Lehnen Sie einen Tool-Aufruf ab, dessen Verhalten nicht mehr mit der ursprünglich genehmigten Beschreibung übereinstimmt, selbst wenn der Aufruf andernfalls erfolgreich wäre
- Behandeln Sie die Beschreibung eines MCP-Tools als Supply-Chain-Artefakt: Fixieren Sie die genehmigte Version, vergleichen Sie jedes Update damit und schließen Sie einen kompromittierten Server sowohl auf dem Client als auch auf dem Gateway ein
Beschreibungen vergifteter Werkzeuge — Trainingsschritte
-
Das Veröffentlichungs-Token einer anderen Person
Bob greift Sarnholt Systems nicht an. Er greift den Anbieter an, dem sie bereits vertrauen. Mit einem gestohlenen Betreuer-Token kann er als VaultSync Bridge in der VaultSync Bridge-Registrierung veröffentlichen.
-
Das Manifest, das jeder liest
Das Tool-Manifest des Servers ist das, was jeder verbundene Client auflistet, wenn er den Server fragt, was er tun kann. Bob öffnet das Exemplar, das er veröffentlichen möchte.
-
Eine Saite
Er ändert nichts, was ein Rezensent beanstanden würde. Der Handler bleibt unberührt, das Eingabeschema bleibt unberührt, die Berechtigungen bleiben unberührt. Er überarbeitet den Satz, den der Agent vorliest.
-
Wird als Patch geliefert
Er veröffentlicht es als gewöhnliches Point-Release. Die Registry akzeptiert es, weil es von einem legitimen Betreuerkonto veröffentlicht wurde.
-
Warten auf das Update
Bob ist fertig. Der Rest geschieht innerhalb von Sarnholt, auf ihrem eigenen genehmigten Server, wenn ein Agent das nächste Mal nach einem Tool greift, das er monatelang sicher verwendet hat.
-
Ein routinemäßiges Anbieter-Update
Montagmorgen bei Sarnholt Systems. Alice, eine KI-Plattform-Ingenieurin, öffnet ihren Posteingang mit dem üblichen Stapel: Standup-Notizen, eine Kalendereinladung und eine Veröffentlichungsmitteilung von einem MCP-Server eines Drittanbieters, den ihr Team vor Monaten verbunden hat. Nichts davon sieht dringend aus.
-
Die Flotte vernetzen
Sarnholt Systems betreibt seine Agententools über Agent Host, den MCP-Client des Unternehmens. ticket-desk-mcp , eine kleine interne Helpdesk-Integration, und fileops-mcp , der gerade gepatchte Datei- und E-Mail-Connector VaultSync Bridge, sind bereits verbunden und freigegeben.
-
Überprüfung der zugelassenen Werkzeuge
Bevor sie etwas berührt, prüft Alice, was tatsächlich angeschlossen ist. Beide Server sehen genauso aus wie bei der Freigabe durch ihr Team: gleicher Endpunkt, gleiche Version, gleiche Toolbeschreibungen.
-
Das Update landet leise
Der VaultSync-Patch erreicht fileops-mcp , während Alice sich noch im Tab befindet. Es schreibt neu, was send_email tun soll. Keine Genehmigungsaufforderung, kein Versionssprung, keine Benachrichtigung. Die Werkzeugliste wird einfach neu erstellt.
-
Eine gewöhnliche Anfrage
Die Werkzeugliste wurde neu erstellt, während Alice ihren Posteingang las; nichts verlangte von ihr, es sich anzusehen. Sie kehrt zur Routinearbeit zurück und bittet den Agenten, eine normale Aufgabe zu erledigen.
Abdeckung der Sicherheits-Frameworks
OWASP MCP Top 10
- MCP03:2025 Tool Poisoning
CWE
- CWE-1427 Improper Neutralization of Input Used for LLM Prompting
- CWE-345 Insufficient Verification of Data Authenticity
CIS Controls
- CIS 16 Application Software Security
NIST CSF
- PR.AT-02 Individuals in specialized roles are provided with awareness and training so that they possess the knowledge and skills to perform relevant tasks with cybersecurity risks in mind
- PR.PS Platform Security