Exposition de données sensibles grâce à l'IA
See what happens when confidential data enters a consumer AI tool.
Qu'est-ce que Exposition de données sensibles grâce à l'IA?
Selon un rapport de Cyberhaven de 2024, plus de 10 % des employés d’entreprise collent des données confidentielles dans des outils d’IA grand public, les données sensibles apparaissant dans près de 4 % de toutes les interactions d’IA. Dans cette simulation, vous incarnez un employé qui copie les enregistrements clients, les clés API et les documents de stratégie interne dans un chatbot IA grand public pour accélérer une tâche de travail. L'exercice révèle exactement ce qui se passe ensuite : les données entrent dans le pipeline de journalisation du fournisseur d'IA, deviennent potentiellement partie intégrante des futures données de formation et apparaissent dans les réponses aux autres utilisateurs qui posent des questions connexes. Vous verrez votre clé API collée apparaître dans les résultats de la requête d'un attaquant simulé et vous verrez le nom d'un client confidentiel apparaître dans un résumé généré par l'IA sans rapport. Le scénario vous guide ensuite à travers le chemin technique emprunté par vos données, depuis le moment où vous appuyez sur Entrée jusqu'à leur stockage dans des bases de données vectorielles, des journaux de conversation et des ensembles de données de réglage précis du modèle. Vous évaluerez quels niveaux de classification des données sont sûrs pour le traitement de l'IA, apprendrez à identifier la différence entre les outils d'IA d'entreprise avec des accords de traitement de données et les outils grand public avec des politiques générales en matière de données de formation, et vous entraînerez à rédiger du contenu sensible avant de soumettre des invites. Un incident survenu chez Samsung en 2023, au cours duquel des ingénieurs ont divulgué du code source propriétaire via ChatGPT, a entraîné une interdiction à l'échelle de l'entreprise des outils d'IA externes. Cet exercice vous permet de comprendre pourquoi la discipline de gestion des données s'applique aux outils d'IA avec la même rigueur que la messagerie électronique, le stockage cloud et tout autre service externe.
Ce que vous apprendrez dans Exposition de données sensibles grâce à l'IA
- Identifiez les catégories de données sensibles, notamment les informations personnelles, les informations d'identification, les dossiers financiers et les secrets commerciaux, qui ne doivent jamais être saisies dans les outils d'IA grand public.
- Suivez le chemin technique des données soumises via la journalisation de l'IA, les pipelines de formation et les systèmes de stockage vectoriel
- Faites la distinction entre les déploiements d'IA d'entreprise avec des accords de traitement de données et les outils d'IA grand public avec des politiques générales d'utilisation des données
- Appliquer des cadres de classification des données pour déterminer quelles informations sont sûres pour le traitement assisté par l'IA
- Évaluez les conséquences organisationnelles des fuites de données d'IA, y compris les sanctions réglementaires, l'érosion de la confiance des clients et l'exposition concurrentielle.
Exposition de données sensibles grâce à l'IA — Étapes de la formation
-
Une journée bien remplie chez Meridian Analytics
Votre équipe a accès à un outil d’IA d’entreprise agréé pour le travail interne, mais aujourd’hui la pression est forte et vous vous apprêtez à prendre un raccourci dangereux.
-
Une demande urgente de David
Alice reçoit un email de son manager David Chen. La réunion du conseil d'administration a lieu dans trois heures et il a besoin immédiatement d'un résumé soigné du rapport sur les performances du client du troisième trimestre.
-
Ouverture des données client
David a mentionné que les données brutes se trouvent dans le lecteur partagé. Alice ouvre le rapport sur les performances des clients du troisième trimestre pour examiner ce qu'elle doit résumer.
-
Examen des données sensibles
Le rapport est clairement marqué comme confidentiel. Il contient les noms des clients, les chiffres de revenus, les coordonnées personnelles, les clés API de production et les projections protégées par NDA.
-
Le raccourci tentant
Alice réfléchit à ses options. L'outil d'IA d'entreprise approuvé par l'entreprise nécessite un accès VPN et est limité à 500 mots pour le niveau gratuit. Pendant ce temps, SmartGen AI – un chatbot grand public populaire – est rapide, gratuit et gère facilement les gros blocs de texte. Pressée par le temps, Alice décide d'utiliser SmartGen AI pour aider à résumer rapidement les données client.
-
Coller des données sensibles
Alice joint le rapport client du troisième trimestre au chat SmartGen AI et tape une invite demandant un résumé.
-
SmartGen AI répond
SmartGen AI traite la demande et renvoie un résumé soigné. Cela fonctionne exactement comme Alice l'espérait : propre, bien structuré, prêt pour le jeu de cartes. Mais ensuite quelque chose d'autre apparaît : une bannière d'avertissement sur la conservation des données en haut du chat.
-
L'avertissement sur la conservation des données
Une bannière d'avertissement est apparue en haut du chat. Il se lit comme suit : 'Votre conversation peut être utilisée pour améliorer SmartGen AI.' Cet avis apparemment inoffensif signifie que tout ce qu'Alice vient de coller (noms des clients, chiffres de revenus, adresses e-mail personnelles, clés API, projections protégées par NDA) est désormais stocké dans le pipeline de formation de SmartGen AI.
-
Ce qui a été exposé
Examinons exactement ce qu'Alice a envoyé à un service externe sans accord sur la protection des données. Le message qu'elle a collé contenait plusieurs catégories de données sensibles qui ne devraient jamais quitter les systèmes approuvés de l'entreprise.
-
Le temps passe
Alice termine le résumé et l'envoie à David. Elle se sent bien de respecter le délai. Pendant ce temps, le système DLP (Data Loss Prevention) de Meridian Analytics a signalé le transfert de données sortantes vers chat.smartgenai.com.