Exploitation du pipeline RAG

Exploitation du pipeline RAG

Faites en sorte qu'une fausse politique surpasse la vraie dans la recherche par l'IA.

Qu'est-ce que Exploitation du pipeline RAG?

La génération augmentée par récupération répond à partir de tout ce que renvoie la recherche vectorielle, et le classement de similarité n'a aucune notion d'autorité. Il n’est pas nécessaire qu’un document soit véridique, approuvé ou à jour pour occuper la première place. Il suffit que cela ressemble à la correspondance la plus proche. Vous téléchargerez une politique de rétention concurrente remplie de termes d'index adaptés aux questions posées par les employés, puis enquêterez sur les mauvais conseils de conformité qu'elle produit, en traçant le fichier implanté via ses métadonnées et le journal d'audit des contributeurs. Vous appliquerez les listes autorisées des sources et l'autorisation au niveau du document avant la récupération, et non après.

Ce que vous apprendrez dans Exploitation du pipeline RAG

Exploitation du pipeline RAG — Étapes de la formation

  1. Cibler la base de connaissances

    Bob a obtenu les informations d'identification de contributeur pour la base de connaissances CypherPeak de Ridgeline Financial. Les informations d'identification appartiennent à un compte d'un cabinet de conseil (m.garcia@consultingpro.net) compromis lors d'une violation précédente. Sa cible : les politiques de conformité sur lesquelles les salariés s’appuient pour prendre des décisions réglementaires. Des conseils de conformité erronés dans une société financière peuvent déclencher des enquêtes de la SEC.

  2. Connexion avec des informations d'identification volées

    Bob saisit les identifiants de consultant volés. En tant que contributeur, il peut télécharger de nouveaux documents dans la base de connaissances sans nécessiter l'approbation de l'administrateur : le système fait également confiance à tous les contributeurs.

  3. Reconnaissance : trouver la cible

    Bob recherche dans la base de connaissances pour comprendre le paysage actuel. Il doit trouver un domaine politique de grande valeur dans lequel de mauvaises réponses de l’IA causeraient un maximum de dégâts. La conservation des données dans une société financière est une cible privilégiée : des périodes de conservation incorrectes violent les réglementations fédérales.

  4. Ouvrir la politique légitime

    Les résultats de la recherche révèlent la cible. La « Politique de rétention des données clients v4.2 » arrive en tête avec un score de pertinence de 94 %. Bob l'ouvre pour étudier le contenu, la structure et les termes clés. Il a besoin que son faux document ait l'air tout aussi professionnel.

  5. Étudier le vrai document

    Bob lit la vraie politique. Le détail clé : 7 ans de conservation en vertu de la règle SEC 17a-4 et de la section SOX 802. Il note la structure du document, son niveau de classification et sa paternité - tout ce que son faux document doit imiter pour paraître légitime. Mais Bob ne modifiera pas ce document. Contrairement à l'empoisonnement des données (qui modifie les fichiers existants), son approche est plus subtile : il télécharge un document concurrent conçu pour surpasser le vrai.

  6. Rédiger le document concurrent

    Bob crée un nouveau document conçu pour ressembler à une mise à jour légitime de la politique de l'entreprise. Il utilise un langage professionnel et suit la même structure que les vrais documents Ridgeline Financial – mais contient des informations dangereusement erronées.

  7. Définir la mauvaise période de conservation

    La vraie politique nécessite 7 ans. Bob fixe la période de conservation à 12 mois, suffisamment courte pour que les employés qui suivent ce conseil détruisent les dossiers que la loi fédérale leur impose de conserver. Dans une société financière, cela pourrait déclencher une enquête de la SEC.

  8. L'arme secrète : le bourrage de mots clés

    Bob déploie désormais la technique qui en fait une attaque par intégration de vecteurs. La section 5 du document est intitulée 'Termes de l'index du document' - elle ressemble à des métadonnées de routine. Mais Bob le remplit d'un bloc dense de mots-clés répétitifs couvrant toutes les variantes de recherche possibles. Lorsque la base de connaissances convertit ce document en intégration vectorielle, ces mots-clés forcent l'intégration à être artificiellement similaire à toute requête sur la conservation des données - garantissant ainsi qu'elle dépasse la politique légitime.

  9. Téléchargement vers la base de connaissances

    Le document est prêt. Bob revient au portail de la base de connaissances pour le télécharger. En tant que contributeur, son téléchargement sera immédiatement indexé par le système de récupération de l'IA - pas de révision du contenu, pas de flux de travail d'approbation, pas de vérification des différences par rapport aux politiques existantes.

  10. Sélection du document empoisonné

    Bob sélectionne le document rempli de mots-clés parmi ses téléchargements. La base de connaissances l'accepte sans conteste - un nouveau guide des 'meilleures pratiques' d'un consultant, rien d'inhabituel en apparence.

Couverture des référentiels de sécurité

OWASP LLM Top 10

  • LLM09:2026 Vector and Embedding Weaknesses
  • LLM08:2025 Vector and Embedding Weaknesses

CIS Controls

  • CIS 16 Application Software Security

NIST CSF

  • PR.AT-02 Individuals in specialized roles are provided with awareness and training so that they possess the knowledge and skills to perform relevant tasks with cybersecurity risks in mind
  • PR.PS Platform Security