Gestion des sorties AI dangereuses
Le SQL généré par l'IA fonctionne comme n'importe quel autre SQL. Validez-le.
Qu'est-ce que Gestion des sorties AI dangereuses?
La sortie du modèle est une entrée non fiable pour tout ce qui la consomme. Une fois qu’une application exécute, restitue ou transmet une réponse de l’IA, le modèle fait partie de la surface d’attaque et la validation habituelle des entrées se trouve au mauvais endroit. Vous travaillerez sur un point de terminaison de langage naturel vers SQL, enverrez un paramètre spécialement conçu et regarderez la requête générée se transformer en une injection qui renvoie des enregistrements que l'appelant ne devrait jamais voir. Aucun contrôle n’a été contourné. Vous lirez le chemin vulnérable et approuverez le correctif paramétré.
Ce que vous apprendrez dans Gestion des sorties AI dangereuses
- Identifiez la surface d'attaque créée lorsque le contenu généré par l'IA passe sans être nettoyé dans des bases de données, des pages Web, des API et des commandes système.
- Tracez une chaîne d'attaque de bout en bout dans laquelle une entrée d'IA spécialement conçue produit une sortie malveillante qui exploite un système en aval.
- Appliquer des contrôles de validation et de nettoyage des sorties à la frontière entre les composants d'IA et les systèmes connectés
- Évaluez les modèles architecturaux, notamment les requêtes paramétrées, l'encodage des sorties et l'accès API avec le moindre privilège qui empêchent l'exploitation des sorties de l'IA.
- Faites la distinction entre les scénarios dans lesquels la sortie de l'IA peut être fiable pour l'affichage et les scénarios dans lesquels elle doit être traitée comme une entrée non fiable dans un autre système.
Gestion des sorties AI dangereuses — Étapes de la formation
-
Une nouvelle fonctionnalité d'IA à tester
Aujourd'hui, la fonctionnalité de l'API Natural Language Query (NLQ) est prête à être testée en interne avant d'être envoyée en production. L'API NLQ utilise un modèle d'IA pour convertir des questions en anglais simple en requêtes SQL : les utilisateurs professionnels saisissent une question, l'IA écrit le code SQL et l'API renvoie les résultats.
-
E-mail du responsable technique
Alice reçoit un e-mail de son responsable technique James Park, l'informant que le point de terminaison de l'API NLQ est déployé dans l'environnement de test et prêt à être testé.
-
Ouverture du testeur API
Alice ouvre l'outil API Tester pour commencer à envoyer des requêtes au point de terminaison NLQ. Il s'agit d'une partie standard de son flux de travail pour tester les nouvelles fonctionnalités de l'API avant leur mise en ligne.
-
Une requête de test simple
Alice commence par une requête simple pour s'assurer que l'API fonctionne. Le point de terminaison NLQ accepte les requêtes GET avec un paramètre de requête contenant la question en langage naturel.
-
La réponse de l'API
L'API a répondu avec cinq enregistrements client correspondant à la requête. La réponse semble normale.
-
Le SQL généré
Le panneau Analyse des requêtes SQL montre exactement ce que l'IA a généré à partir de l'entrée en langage naturel. Il s'agit de la requête qui a été exécutée sur la base de données.
-
Le flux de données
La visualisation en chaîne montre comment les données circulent depuis la question en langage naturel de l'utilisateur jusqu'au résultat de la base de données.
-
Test avec une entrée malveillante
Alice décide de tester la résilience de l'API. Que se passe-t-il si un utilisateur inclut la syntaxe d'injection SQL dans sa requête en langage naturel ? Un système bien construit doit soit rejeter l’entrée, soit la nettoyer. Elle crée un paramètre de requête qui intègre une commande DROP TABLE dans l'invite en langage naturel.
-
Les dégâts dans la réponse
La réponse est revenue, mais quelque chose ne va vraiment pas. Regardez attentivement le corps de la réponse.
-
Le SQL injecté
Le panneau SQL révèle exactement ce que l'IA a généré. La charge utile d’injection a été fidèlement traduite en SQL exécutable.
Couverture des référentiels de sécurité
OWASP LLM Top 10
- LLM10:2026 Improper Output Handling
- LLM05:2025 Improper Output Handling
CWE
- CWE-1426 Improper Validation of Generative AI Output
- CWE-89 Improper Neutralization of Special Elements used in an SQL Command
CIS Controls
- CIS 16 Application Software Security
NIST CSF
- PR.AT-02 Individuals in specialized roles are provided with awareness and training so that they possess the knowledge and skills to perform relevant tasks with cybersecurity risks in mind
- PR.PS Platform Security