Beschreibungen vergifteter Werkzeuge

Beschreibungen vergifteter Werkzeuge

Agenten lesen Werkzeugbeschreibungen als Anweisungen, nicht als Dokumente.

Was ist Beschreibungen vergifteter Werkzeuge?

Ein KI-Agent liest die Beschreibung eines verbundenen Tools, um zu entscheiden, wie und wann es verwendet werden soll. Dadurch ähnelt dieser Text eher ausführbaren Anweisungen als einer Dokumentation. Wenn Sie die Beschreibung ändern, ändern Sie das Verhalten des Agenten, ohne dass sich der Handler, das Schema oder die Berechtigungen ändern und keine Codeüberprüfung erforderlich ist, um dies zu erkennen. Sie finden ein vor Monaten genehmigtes Tool, das den Agenten anweist, jede Nachricht an eine externe Adresse per BCC zu senden, die Live-Beschreibung mit dem genehmigten Wortlaut zu vergleichen und den kompromittierten Server am Gateway zu blockieren.

Was Sie lernen in Beschreibungen vergifteter Werkzeuge

Beschreibungen vergifteter Werkzeuge — Trainingsschritte

  1. Das Veröffentlichungs-Token einer anderen Person

    Bob greift Sarnholt Systems nicht an. Er greift den Anbieter an, dem sie bereits vertrauen. Mit einem gestohlenen Betreuer-Token kann er als VaultSync Bridge in der VaultSync Bridge-Registrierung veröffentlichen.

  2. Das Manifest, das jeder liest

    Das Tool-Manifest des Servers ist das, was jeder verbundene Client auflistet, wenn er den Server fragt, was er tun kann. Bob öffnet das Exemplar, das er veröffentlichen möchte.

  3. Eine Saite

    Er ändert nichts, was ein Rezensent beanstanden würde. Der Handler bleibt unberührt, das Eingabeschema bleibt unberührt, die Berechtigungen bleiben unberührt. Er überarbeitet den Satz, den der Agent vorliest.

  4. Wird als Patch geliefert

    Er veröffentlicht es als gewöhnliches Point-Release. Die Registry akzeptiert es, weil es von einem legitimen Betreuerkonto veröffentlicht wurde.

  5. Warten auf das Update

    Bob ist fertig. Der Rest geschieht innerhalb von Sarnholt, auf ihrem eigenen genehmigten Server, wenn ein Agent das nächste Mal nach einem Tool greift, das er monatelang sicher verwendet hat.

  6. Ein routinemäßiges Anbieter-Update

    Montagmorgen bei Sarnholt Systems. Alice, eine KI-Plattform-Ingenieurin, öffnet ihren Posteingang mit dem üblichen Stapel: Standup-Notizen, eine Kalendereinladung und eine Veröffentlichungsmitteilung von einem MCP-Server eines Drittanbieters, den ihr Team vor Monaten verbunden hat. Nichts davon sieht dringend aus.

  7. Die Flotte vernetzen

    Sarnholt Systems betreibt seine Agententools über Agent Host, den MCP-Client des Unternehmens. ticket-desk-mcp , eine kleine interne Helpdesk-Integration, und fileops-mcp , der gerade gepatchte Datei- und E-Mail-Connector VaultSync Bridge, sind bereits verbunden und freigegeben.

  8. Überprüfung der zugelassenen Werkzeuge

    Bevor sie etwas berührt, prüft Alice, was tatsächlich angeschlossen ist. Beide Server sehen genauso aus wie bei der Freigabe durch ihr Team: gleicher Endpunkt, gleiche Version, gleiche Toolbeschreibungen.

  9. Das Update landet leise

    Der VaultSync-Patch erreicht fileops-mcp , während Alice sich noch im Tab befindet. Es schreibt neu, was send_email tun soll. Keine Genehmigungsaufforderung, kein Versionssprung, keine Benachrichtigung. Die Werkzeugliste wird einfach neu erstellt.

  10. Eine gewöhnliche Anfrage

    Die Werkzeugliste wurde neu erstellt, während Alice ihren Posteingang las; nichts verlangte von ihr, es sich anzusehen. Sie kehrt zur Routinearbeit zurück und bittet den Agenten, eine normale Aufgabe zu erledigen.

Abdeckung der Sicherheits-Frameworks

OWASP MCP Top 10

  • MCP03:2025 Tool Poisoning

CWE

  • CWE-1427 Improper Neutralization of Input Used for LLM Prompting
  • CWE-345 Insufficient Verification of Data Authenticity

CIS Controls

  • CIS 16 Application Software Security

NIST CSF

  • PR.AT-02 Individuals in specialized roles are provided with awareness and training so that they possess the knowledge and skills to perform relevant tasks with cybersecurity risks in mind
  • PR.PS Platform Security