Partager un jeu de données sans exposer d'informations personnelles : méthode en 5 étapes
Une méthode reproductible pour préparer un fichier CSV à partager — associations, chercheurs, journalistes data — sans exposer d'informations personnelles identifiables.
Partager un jeu de données tabulaire — pour une association, une étude, un projet de recherche ou un usage journalistique — demande une méthode systématique plutôt qu’un traitement au cas par cas, car le risque de réidentification ne vient pas seulement des colonnes évidentes (nom, e-mail) mais aussi de leur combinaison avec des colonnes apparemment anodines.
La première étape est d’inventorier toutes les colonnes du fichier et de les classer en trois catégories : directement identifiantes (nom, e-mail, numéro de téléphone, identifiant unique), indirectement identifiantes (code postal, date de naissance, profession, employeur), et non identifiantes en apparence. Cette classification détermine le traitement à appliquer à chaque colonne plutôt que de deviner colonne par colonne au moment du traitement.
La deuxième étape est de traiter les colonnes directement identifiantes : les retirer complètement quand elles n’apportent aucune valeur analytique au jeu de données partagé, ou les remplacer par un hachage stable quand une cohérence entre lignes doit être conservée (par exemple, relier plusieurs commandes du même client sans révéler son identité).
La troisième étape, souvent négligée, est de traiter les colonnes indirectement identifiantes par généralisation plutôt que par simple masquage : remplacer une date de naissance précise par une tranche d’âge, un code postal complet par les deux premiers chiffres, une profession très spécifique par une catégorie plus large. C’est cette étape qui réduit le risque d’individualisation — la possibilité d’isoler une personne unique dans le jeu de données par la combinaison de plusieurs colonnes rares prises ensemble.
La quatrième étape est de vérifier, après traitement, qu’aucune ligne ne reste unique sur la combinaison des colonnes conservées : une ligne identifiable par recoupement (la seule personne d’un certain âge dans un certain quartier exerçant une profession donnée, par exemple) reste un risque de réidentification même si aucune colonne prise isolément n’est identifiante.
La cinquième étape est de documenter le traitement appliqué — quelles colonnes ont été retirées, hachées ou généralisées, et pourquoi — pour permettre à un tiers de comprendre les limites du jeu de données partagé, et de refaire le même traitement de façon cohérente si le jeu de données doit être mis à jour ou complété ultérieurement.
Traiter un CSV colonne par colonne →
Formats concernés
Voir aussi
- Anonymisation vs pseudonymisation : ce que dit vraiment le RGPD
- Préparer un dataset pour une publication en data-journalisme sans compromettre ses sources
Sources
Dernière mise à jour :