Évaluer l'anonymisation d'un jeu de données
Avant de partager un jeu de données avec des partenaires externes, de le publier en open data ou de l'utiliser pour entraîner des modèles, une entreprise doit s'assurer que les données personnelles sont correctement anonymisées. Ce skill permet d'auditer le jeu de données et de recommander les techniques d'anonymisation appropriées.
Télécharger le skill (.zip) Guide d'installation
Objectif
Avant de partager un jeu de données avec des partenaires externes, de le publier en open data ou de l'utiliser pour entraîner des modèles, une entreprise doit s'assurer que les données personnelles sont correctement anonymisées. Ce skill permet d'auditer le jeu de données et de recommander les techniques d'anonymisation appropriées.
Méthode : Le skill analyse le jeu de données et son dictionnaire pour identifier les identifiants directs et indirects. Il évalue les risques de réidentification selon les trois critères du G29 (individualisation, corrélation, inférence). Il propose ensuite des techniques d'anonymisation adaptées (k-anonymat, l-diversité, perturbation, généralisation) en fonction du cas d'usage cible, tout en préservant l'utilité statistique des données.
Entrées acceptées
Ce que vous obtenez
Limites et supervision humaine
Ce skill produit une aide de travail qui doit être relue et validée par un humain avant toute décision, diffusion ou dépôt.
Limite principale : Le risque principal est une anonymisation incomplète laissant des possibilités de réidentification par croisement de données. Une validation humaine par le DPO (Délégué à la Protection des Données) ou un expert en sécurité est indispensable avant toute diffusion du jeu de données. L'outil ne remplace pas une analyse d'impact relative à la protection des données (AIPD) si elle est requise.
Il distingue les faits, les calculs et les hypothèses, n'invente aucune donnée et signale ce qui reste à confirmer.
Sources officielles
Références utilisées pour cadrer la méthode. Vérifiez leur version à la date d'utilisation.
Aperçu du SKILL.md
Premières lignes du fichier embarqué dans l'archive — le contrat d'exécution du skill.
---
name: evaluer-anonymisation-donnees
description: Avant de partager un jeu de données avec des partenaires externes, de le publier en open data ou de l'utiliser pour entraîner des modèles, une entreprise doit s'assurer que les données personnelles sont correctement anonymisées. Ce skill permet d'auditer le jeu de données et de recommander les techniques d'anonymisation appropriées.
---
# Évaluer l'anonymisation d'un jeu de données
## Mission
Auditer un jeu de données et son dictionnaire pour évaluer les risques de réidentification et recommander les techniques d'anonymisation appropriées selon le contexte d'utilisation cible.
## Résultat attendu
1. **Rapport d'audit d'anonymisation** (selon `templates/evaluer-anonymisation-donnees-output.md`) : synthèse des risques et plan d'action.
2. **Matrice des risques de réidentification** : évaluation selon l'individualisation, la corrélation et l'inférence.
3. **Recommandations de transformation des données** : techniques suggérées (k-anonymat, l-diversité, perturbation, généralisation).
4. **Code de preuve de concept (POC)** : exemple de script d'anonymisation.
## Situations d'usage
- Avant de partager un jeu de données avec des partenaires externes.
- Préparation d'une publication en open data.
- Constitution de jeux de données pour entraîner des modèles ou réaliser des tests.
## Ce que le skill ne fait pas
- Remplacer une analyse d'impact relative à la protection des données (AIPD) si elle est requise.
- Réaliser l'anonymisation complète et définitive des données de production (fournit un POC).
- Garantir l'impossibilité absolue de réidentification (risque zéro inexistant).
- Traiter de la qualité, de la documentation, de la visualisation ou de l'exploration générale des données.
## Entrées obligatoires
1. Jeu de données brut (CSV, Excel).
2. Dictionnaire de données associé.
3. Contexte d'utilisation cible (open data, test, recherche).
## Entrées facultatives
- Contraintes spécifiques de préservation de l'utilité statistique.
- Politiques internes de sécurité des données.
- Jeux de données externes potentiellement croisables connus.
## Validation préalable
1. Vérifier la présence du jeu de données, du dictionnaire et du contexte d'utilisation.
2. Interrompre si les données contiennent des identifiants directs évidents non documentés sans justification de test.
3. Ne jamais inventer de faits, de chiffres, de conformité ou de citations.
4. Signaler immédiatement toute donnée hautement sensible (santé, opinions, etc.) nécessitant un traitement renforcé.
## Méthodologie
1. Analyser le dictionnaire de données et le jeu de données pour classifier les variables (identifiants directs, quasi-identifiants, données sensibles, données non sensibles).
2. Évaluer les risques de réidentification selon les trois critères du G29 : individualisation, corrélation, inférence.
3. Identifier les techniques d'anonymisation adaptées (k-anonymat, l-diversité, t-proximité, perturbation, généralisation) en fonction du cas d'usage cible et de l'utilité requise.
4. Rédiger le rapport d'audit et la matrice des risques.
5. Générer un code de preuve de concept (POC) illustrant les transformations recommandées.
## Règles de décision
- Les calculs (ex: taux de k-anonymat) doivent expliciter les formules, unités, arrondis, données manquantes et rapprochements.
- Si le contexte cible est "open data", privilégier les techniques offrant la plus forte garantie d'anonymat, quitte à réduire l'utilité.
- Si le contexte cible est "recherche", équilibrer l'anonymisation et la préservation des propriétés statistiques.
- Toute recommandation technique doit être justifiée par rapport aux critères du G29.
## Contrôles qualité
- Le rapport mentionne explicitement les trois critères du G29.
- La matrice des risques couvre toutes les variables identifiées comme quasi-identifiants.
- Le code de POC est commenté, syntaxiquement correct et utilise des bibliothèques standards (ex: pandas en Python).
- Aucune donnée réelle du jeu de données brut n'est exposée dans le rapport final (utiliser des exemples fictifs si nécessaire).
## Format de sortie
- Rapport structuré utilisant le template `templates/evaluer-anonymisation-donnees-output.md`.
- Matrice des risques en format tableau Markdown.
- Bloc de code pour le POC.
- Avertissement clair sur la nécessité d'une validation humaine.
## Convention de confiance
- Les données fournies en entrée sont considérées comme représentatives.
- Le skill agit comme un assistant d'analyse et de recommandation.
- Toute décision réglementaire, juridique, fiscale, RH, financière, sécurité ou conformité requiert une validation humaine.
## Gestion des erreurs
- Si le dictionnaire de données est manquant ou incomplet : demander des clarifications ou formuler des hypothèses explicites marquées comme telles.
- Si le format du jeu de données n'est pas supporté : indiquer les formats acceptés (CSV, Excel).
- Si les calculs échouent en raison de données manquantes : l'expliciter dans le rapport.
## Limites
- L'évaluation des risques d'inférence et de corrélation avec des bases de données externes inconnues est limitée.
- L'outil fournit une évaluation technique qui doit être complétée par une expertise juridique.
- Le risque principal est une anonymisation incomplète laissant des possibilités de réidentification par croisement de données. Une validation humaine par le DPO (Délégué à la Protection des Données) ou un expert en sécurité est indispensable avant toute diffusion du jeu de données.
## Exemple
Demande : "Voici un extrait CSV de notre base clients et son dictionnaire. Nous voulons le publier en open data. Évalue l'anonymisation nécessaire."
Traitement : Analyse des colonnes (Nom, Prénom, Code Postal, Date de Naissance, Montant Achat). Identification de Nom/Prénom comme identifiants directs à supprimer. Identification de Code Postal et Date de Naissance comme quasi-identifiants présentant un risque d'individualisation. Recommandation de généralisation (Code Postal sur 2 chiffres, Année de naissance) pour atteindre un k-anonymat suffisant. Génération du rapport, de la matrice et du script Python de transformation.
## Protocole de traçabilité
Pour chaque donnée utilisée, conserver le nom du document, sa date, la rubrique consultée et le passage utile. Pour chaque calcul, indiquer la formule, les valeurs d'entrée, l'unité, la règle d'arrondi et le résultat. Si plusieurs documents se contredisent, ne pas choisir silencieusement : présenter les versions, expliquer l'impact et demander un arbitrage. Les sources externes listées dans `references/sources.md` servent de repères ; vérifier leur version et leur date avant usage.
Installation
- Téléchargez le fichier. Pour vérifier son intégrité, utilisez
shasum -a 256 evaluer-anonymisation-donnees.zipet comparez le résultat avec l'empreinte affichée dans la fiche technique. - Décompressez-le : vous obtenez un dossier contenant
SKILL.mdet ses ressources. - Importez le dossier dans claude.ai, Claude Code ou via l'API.