Gouvernance des données IA

Gouvernance des données IA

Examiner la qualité des données de formation par rapport aux exigences de l’article 10 de la loi européenne sur l’IA.

Qu'est-ce que Gouvernance des données IA?

L’article 10 de la loi européenne sur l’IA fixe des exigences en matière de gouvernance des données pour les systèmes d’IA à haut risque, et cette obligation intervient avant le début de la formation plutôt qu’après un mauvais comportement d’un modèle. Vous examinerez un ensemble de données d'entraînement pour en vérifier la représentativité, la qualité des données, les fuites entre les fractionnements d'entraînement et de test, ainsi que les données personnelles qui n'ont jamais été nécessaires, puis déciderez si l'ensemble est adapté à l'entraînement. Vous pourrez dire ce qui rend un jeu de données conforme et ce qui le bloque.

Ce que vous apprendrez dans Gouvernance des données IA

Gouvernance des données IA — Étapes de la formation

  1. Article 10 : Gouvernance des données

    L’article 10 de la loi de l’UE sur l’IA établit des exigences en matière de gouvernance des données pour les systèmes d’IA à haut risque. Les données de formation, de validation et de test doivent répondre à des critères de qualité stricts : Les données doivent être pertinentes par rapport à la tâche pour laquelle le système d'IA est conçu. Les données doivent être suffisamment représentatives de la population que le modèle servira. Les données doivent être aussi exemptes d'erreurs que possible et adaptées à l'objectif visé. Les pratiques de gouvernance des données doivent s'attaquer aux biais potentiels qui pourraient conduire à des résultats discriminatoires. Des données médiocres conduisent à une IA biaisée, et une IA biaisée entraîne une responsabilité juridique. La gouvernance des données n’est pas une bonne pratique en vertu de la loi européenne sur l’IA : c’est une obligation légale.

  2. Demande d'examen de l'ensemble de données

    Un e-mail arrive de Marcus Rodriguez, le chef de l'équipe IA. L'équipe se prépare à former ChurnPredict v3 et l'ensemble de données nécessite un examen de conformité avant que la formation puisse commencer. L'e-mail renvoie directement à l'ensemble de données sur la plateforme DataOps.

  3. Problème 1 : Sous-représentation régionale

    La plateforme DataOps charge la revue de l'ensemble de données ChurnPredict v3. La répartition régionale des données de formation se démarque immédiatement : l'ensemble de données est fortement concentré dans une seule région, bien que le modèle soit conçu pour servir les quatre de manière égale.

  4. Problème 2 : Données périmées avant la pandémie

    Le calendrier de collecte des données révèle une autre préoccupation. Une partie importante des enregistrements est antérieure à un changement fondamental dans le comportement des clients.

  5. Problème 3 : Fuite de données

    Un examen plus attentif de la liste des fonctionnalités révèle un problème critique de qualité des données qui compromettrait entièrement le modèle.

  6. Contrôle des connaissances : représentativité des données

    Avant de poursuivre l'examen, une question sur la question de la répartition régionale.

  7. Problème 4 : Données personnelles inutiles

    La dernière section de l’examen révèle un risque de non-conformité qui s’étend au-delà de la loi sur l’IA jusqu’au territoire du RGPD.

  8. Résumé de l'examen

    Alice a terminé l'examen de la gouvernance des données. Quatre problèmes critiques doivent être résolus avant que la formation du modèle puisse commencer : Sous-représentation régionale grave – 72 % de données sur la région Nord pour un modèle desservant 4 régions de manière égale. L'ensemble de données doit être rééquilibré pour représenter adéquatement toutes les régions de déploiement. Données pré-pandémiques obsolètes – 38 % des enregistrements de 2019-2020 ne reflètent plus le comportement actuel des clients. Ces enregistrements doivent être exclus ou pondérés de manière appropriée. Fuite de données - la fonctionnalité account_status encode directement la variable cible et doit être supprimée pour éviter une précision de formation artificiellement gonflée. PII inutiles - les noms, e-mails, numéros de téléphone et adresses bruts créent une exposition au RGPD sans contribuer à la prévision du taux de désabonnement. Ces champs doivent être supprimés ou pseudonymisés.

  9. Déposer un rapport de conformité

    Identifier les lacunes ne représente que la moitié du travail. En vertu de l'article 10, l'examen de la gouvernance des données doit être documenté et transmis au chef de l'équipe IA et au délégué à la protection des données afin que la formation du modèle soit suspendue jusqu'à ce que les problèmes soient résolus.

  10. Soumettre le rapport de conformité

    Alice remplit le rapport avec les résultats, les quatre lacunes mappées à l'article 10 et au RGPD, ainsi que les actions que l'équipe d'IA doit accomplir avant la reprise de la formation.

Couverture des référentiels de sécurité

NIST CSF

  • PR.AT-01 Personnel are provided with awareness and training so that they possess the knowledge and skills to perform general tasks with cybersecurity risks in mind

GDPR

  • Art. 5 Principles relating to processing of personal data

EU AI Act

  • Art. 10 Data and data governance