Skip to main content

Article 10 règlement IA : exigences données d'entraînement

Ce que l'article 10 du règlement IA exige pour les données d'entraînement, validation et test : qualité, détection des biais, documentation.

L'article 10 du règlement européen sur l'IA impose aux fournisseurs de systèmes d'IA à haut risque d'appliquer des pratiques de gouvernance et de gestion des données aux ensembles de données d'entraînement, de validation et de test tout au long du cycle de vie du système d'IA.

Exigences en matière de gouvernance des données

Choix de conception & collecte de données

Documentez les choix de conception pertinents pour les processus de collecte de données, y compris les sources de données, les méthodes de collecte et la justification de la composition de l'ensemble de données.

Processus de collecte de données

Établissez des processus clairs pour la collecte de données d'entraînement, de validation et de test alignés sur la finalité prévue du système d'IA.

Préparation & annotation des données

Appliquez des opérations appropriées de préparation des données, notamment l'annotation, l'étiquetage, le nettoyage, l'enrichissement et l'agrégation pour garantir la qualité de l'ensemble de données.

Examen & atténuation des biais

Examinez les ensembles de données à la recherche de biais éventuels susceptibles d'affecter la santé, la sécurité ou les droits fondamentaux, ou de conduire à une discrimination interdite.

Lacunes & exhaustivité des données

Identifiez et comblez les lacunes ou insuffisances des données pour garantir que les ensembles de données sont pertinents, suffisamment représentatifs et complets pour la finalité prévue.

Étapes de mise en œuvre

Documentation des ensembles de données as code

Maintenez les spécifications des ensembles de données, les méthodes de collecte et les étapes de préparation dans des fichiers de configuration versionnés aux côtés du code de votre système d'IA.

Tests automatisés de biais & dérive

Intégrez la détection automatisée de biais et les tests de dérive des données dans votre pipeline CI/CD pour détecter les problèmes avant le déploiement.

Traçabilité de la lignée des données

Mettez en œuvre un suivi de bout en bout des sources de données, des transformations et du versionnement pour maintenir une visibilité complète sur la provenance des ensembles de données.

Fiches d'ensembles de données versionnées

Créez des fiches d'ensembles de données structurées documentant la composition, la méthodologie de collecte, les limites connues et les résultats d'examen des biais pour chaque version d'ensemble de données.

Considérations RGPD

L'article 10(5) autorise le traitement de données à caractère personnel sensibles strictement pour détecter et corriger les biais, sous réserve de garanties appropriées, notamment des limitations techniques, des mesures de sécurité à la pointe de la technologie et la suppression une fois le biais corrigé ou la limite de conservation des données atteinte.

Questions fréquentes

Exigences connexes


Comment Scanara vous aide

Scanara automatise la conformité au règlement sur l'IA du code au dossier. Connectez vos repos GitHub et obtenez des rapports de conformité en quelques minutes.