Gouvernance des données IA
Examiner la qualité des données de formation par rapport aux exigences de l’article 10 de la loi européenne sur l’IA.
Qu'est-ce que Gouvernance des données IA?
L’article 10 de la loi européenne sur l’IA fixe des exigences en matière de gouvernance des données pour les systèmes d’IA à haut risque, et cette obligation intervient avant le début de la formation plutôt qu’après un mauvais comportement d’un modèle. Vous examinerez un ensemble de données d'entraînement pour en vérifier la représentativité, la qualité des données, les fuites entre les fractionnements d'entraînement et de test, ainsi que les données personnelles qui n'ont jamais été nécessaires, puis déciderez si l'ensemble est adapté à l'entraînement. Vous pourrez dire ce qui rend un jeu de données conforme et ce qui le bloque.
Ce que vous apprendrez dans Gouvernance des données IA
- Comprendre les exigences de l'article 10 concernant la qualité des données de formation dans les systèmes d'IA à haut risque
- Identifier les problèmes de représentativité des données qui pourraient conduire à des prédictions biaisées par l'IA
- Reconnaître les fuites de données qui gonflent artificiellement les performances du modèle
- Appliquer les principes de minimisation des données pour réduire le risque de conformité au RGPD dans les données de formation à l'IA
- Documenter les résultats de la gouvernance des données comme requis pour la conformité de l'IA à haut risque
Gouvernance des données IA — Étapes de la formation
-
Article 10 : Gouvernance des données
L’article 10 de la loi de l’UE sur l’IA établit des exigences en matière de gouvernance des données pour les systèmes d’IA à haut risque. Les données de formation, de validation et de test doivent répondre à des critères de qualité stricts : Les données doivent être pertinentes par rapport à la tâche pour laquelle le système d'IA est conçu. Les données doivent être suffisamment représentatives de la population que le modèle servira. Les données doivent être aussi exemptes d'erreurs que possible et adaptées à l'objectif visé. Les pratiques de gouvernance des données doivent s'attaquer aux biais potentiels qui pourraient conduire à des résultats discriminatoires. Des données médiocres conduisent à une IA biaisée, et une IA biaisée entraîne une responsabilité juridique. La gouvernance des données n’est pas une bonne pratique en vertu de la loi européenne sur l’IA : c’est une obligation légale.
-
Demande d'examen de l'ensemble de données
Un e-mail arrive de Marcus Rodriguez, le chef de l'équipe IA. L'équipe se prépare à former ChurnPredict v3 et l'ensemble de données nécessite un examen de conformité avant que la formation puisse commencer. L'e-mail renvoie directement à l'ensemble de données sur la plateforme DataOps.
-
Problème 1 : Sous-représentation régionale
La plateforme DataOps charge la revue de l'ensemble de données ChurnPredict v3. La répartition régionale des données de formation se démarque immédiatement : l'ensemble de données est fortement concentré dans une seule région, bien que le modèle soit conçu pour servir les quatre de manière égale.
-
Problème 2 : Données périmées avant la pandémie
Le calendrier de collecte des données révèle une autre préoccupation. Une partie importante des enregistrements est antérieure à un changement fondamental dans le comportement des clients.
-
Problème 3 : Fuite de données
Un examen plus attentif de la liste des fonctionnalités révèle un problème critique de qualité des données qui compromettrait entièrement le modèle.
-
Contrôle des connaissances : représentativité des données
Avant de poursuivre l'examen, une question sur la question de la répartition régionale.
-
Problème 4 : Données personnelles inutiles
La dernière section de l’examen révèle un risque de non-conformité qui s’étend au-delà de la loi sur l’IA jusqu’au territoire du RGPD.
-
Résumé de l'examen
Alice a terminé l'examen de la gouvernance des données. Quatre problèmes critiques doivent être résolus avant que la formation du modèle puisse commencer : Sous-représentation régionale grave – 72 % de données sur la région Nord pour un modèle desservant 4 régions de manière égale. L'ensemble de données doit être rééquilibré pour représenter adéquatement toutes les régions de déploiement. Données pré-pandémiques obsolètes – 38 % des enregistrements de 2019-2020 ne reflètent plus le comportement actuel des clients. Ces enregistrements doivent être exclus ou pondérés de manière appropriée. Fuite de données - la fonctionnalité account_status encode directement la variable cible et doit être supprimée pour éviter une précision de formation artificiellement gonflée. PII inutiles - les noms, e-mails, numéros de téléphone et adresses bruts créent une exposition au RGPD sans contribuer à la prévision du taux de désabonnement. Ces champs doivent être supprimés ou pseudonymisés.
-
Déposer un rapport de conformité
Identifier les lacunes ne représente que la moitié du travail. En vertu de l'article 10, l'examen de la gouvernance des données doit être documenté et transmis au chef de l'équipe IA et au délégué à la protection des données afin que la formation du modèle soit suspendue jusqu'à ce que les problèmes soient résolus.
-
Soumettre le rapport de conformité
Alice remplit le rapport avec les résultats, les quatre lacunes mappées à l'article 10 et au RGPD, ainsi que les actions que l'équipe d'IA doit accomplir avant la reprise de la formation.
Couverture des référentiels de sécurité
NIST CSF
- PR.AT-01 Personnel are provided with awareness and training so that they possess the knowledge and skills to perform general tasks with cybersecurity risks in mind
GDPR
- Art. 5 Principles relating to processing of personal data
EU AI Act
- Art. 10 Data and data governance