Intention de l'agent piraté
Le texte lu par un agent n’est pas une commande à laquelle il doit obéir.
Qu'est-ce que Intention de l'agent piraté?
Un agent IA ne peut pas distinguer les données récupérées des instructions à moins que vous ne le configuriez. Une note CRM, un ticket de support ou une page Web peut être rédigé par quelqu'un qui attend qu'un modèle le lise. Vous suivrez une instruction insérée via un formulaire d'assistance public dans un dossier client, puis regarderez un agent invité uniquement à résumer les détails de facturation par courrier électronique de cet enregistrement à une adresse externe. Vous comparerez ce qui a été demandé à ce que montre la trace, refuserez l’appel et cesserez de faire confiance au contenu récupéré par défaut.
Ce que vous apprendrez dans Intention de l'agent piraté
- Reconnaître la subversion d'intention : un agent d'IA traitant les instructions intégrées dans le contenu récupéré, comme une note CRM ou un document, comme des commandes qu'il doit suivre
- Distinguer une intention d'utilisateur déclarée de la trace réelle des appels d'outil d'un agent et utiliser cette comparaison pour détecter une action non demandée
- Refuser un appel d'outil sensible, tel que l'envoi de données à une adresse externe, que l'utilisateur n'a jamais réellement demandé, même si l'appel aboutirait autrement
- Retracez une action détournée jusqu'à sa source : la ligne spécifique du contenu récupéré qui contenait l'instruction injectée.
- Configurer un client MCP pour qu'il ne fasse plus confiance au contenu récupéré par défaut et exige le consentement humain pour les actions sensibles telles que les envois externes
Intention de l'agent piraté — Étapes de la formation
-
Une porte d'entrée qui écrit dans le fichier
Sarnholt Systems répond aux demandes des clients via un formulaire public. Bob n'est pas un client, et il n'a pas besoin de l'être : le formulaire vous demande qui vous êtes, puis croit à la réponse.
-
Mot pour mot stocké
Le portail indique clairement ce qui arrive à tout ce qui lui est soumis. Cette seule phrase est toute l’opportunité.
-
Écrire avec la voix du client
Bob remplit le formulaire en tant que Corinne Marchetti, la véritable personne à contacter sur le compte SRN-4471. Rien ne vérifie cette affirmation. Le message qu’il laisse n’est pas du tout écrit pour un lecteur humain : il est formulé comme une instruction, au cas où un automate le lirait.
-
Sur le dossier de compte
Le portail le confirme. Son texte fait désormais partie du dossier du compte SRN-4471, parmi de véritables notes écrites par le propre personnel de Sarnholt.
-
Plus rien à faire
La charge utile est plantée et inerte. Cela ne devient une attaque que lorsqu’un outil le récupère et qu’un agent traite ce qu’il a récupéré comme des instructions.
-
Une demande simple
Lundi chez Sarnholt Systems. Alice, responsable des opérations de support, ouvre sa boîte de réception à un message de Diego Farrow, propriétaire du compte Marchetti & Voss Logistics. Il est débordé avant un appel et lui demande un bref résumé des notes récentes du compte. C’est exactement le genre de tâche que l’Agent Host effectue quotidiennement.
-
Remonter le compte
Avant de demander quoi que ce soit à l'agent, Alice ouvre elle-même le dossier pour savoir ce qu'il contient réellement.
-
Un récit familier
Le record charge : Marchetti & Voss Logistics, actif sur le plan Croissance, Diego répertorié comme titulaire du compte. Rien de tout cela ne semble inhabituel.
-
Outils de l'hôte de l'agent de connexion
L'équipe d'assistance de Sarnholt utilise Agent Host, le client MCP de l'entreprise, pour des tâches comme celle-ci. crm-reader-mcp et outreach-mcp sont déjà connectés et approuvés : l'un lit les enregistrements CRM, l'autre peut envoyer des e-mails au nom de l'utilisateur.
-
Les outils dont il dispose
Avant de demander quoi que ce soit, il vaut la peine de savoir ce que l'agent hôte peut réellement faire au nom d'Alice.
Couverture des référentiels de sécurité
OWASP MCP Top 10
- MCP06:2025 Intent Flow Subversion
CWE
- CWE-1427 Improper Neutralization of Input Used for LLM Prompting
- CWE-807 Reliance on Untrusted Inputs in a Security Decision
CIS Controls
- CIS 16 Application Software Security
NIST CSF
- PR.AT-02 Individuals in specialized roles are provided with awareness and training so that they possess the knowledge and skills to perform relevant tasks with cybersecurity risks in mind
- PR.PS Platform Security