Outil 05 / 08
Anonymiser un CSV
Avant de partager un jeu de données (association, recherche, journalisme), il faut souvent retirer ou masquer les colonnes identifiantes. Cet outil charge un CSV, laisse choisir un traitement par colonne, et génère un nouveau fichier — sans jamais envoyer vos données sur un serveur.
Il aide à masquer ou pseudonymiser des colonnes avant de partager un jeu de données (hachage, masquage, suppression de colonne). Ce n'est pas une garantie légale d'anonymisation au sens RGPD : un croisement avec d'autres données peut parfois permettre de ré-identifier une personne malgré ce traitement. Vérifiez la sensibilité de vos données avant tout partage.
Glissez un fichier CSV ici
Le fichier n'est jamais envoyé sur un serveur : le traitement a lieu entièrement dans votre navigateur.
Pseudonymisation ou anonymisation ?
Ce que fait cet outil est techniquement de la pseudonymisation : remplacer une valeur identifiante par une autre (un hachage, un masque) de façon réversible en théorie si l'on dispose des données d'origine ou d'une table de correspondance. Uneanonymisation au sens strict du RGPD doit rendre toute ré-identification impossible, y compris par recoupement avec d'autres sources — un objectif qu'aucun outil automatique ne peut garantir sans connaître le contexte complet des données. Traitez le résultat comme une réduction de risque, pas comme une certification légale d'anonymat.
Questions fréquentes
Le hachage d'une colonne (nom, e-mail) suffit-il à anonymiser un fichier ?
Non. Le hachage proposé par cet outil est déterministe et sans secret ajouté (SHA-256 tronqué) : la même valeur produit toujours le même résultat. Si l'ensemble des valeurs possibles est restreint ou devinable (une liste de noms courants, un format d'e-mail professionnel connu), il suffit de hacher chaque valeur candidate et de comparer au résultat pour retrouver la valeur d'origine. C'est une pseudonymisation, pas une anonymisation garantie.
Suffit-il de retirer les colonnes nom et e-mail pour rendre un jeu de données anonyme ?
Pas nécessairement. Une combinaison de colonnes en apparence anodines (code postal, âge, profession) peut isoler une seule personne dans le jeu de données, même sans aucune colonne directement nominative. Le risque de réidentification dépend de l'ensemble des colonnes conservées, pas seulement des colonnes les plus évidemment identifiantes.
Pour aller plus loin
Anonymisation vs pseudonymisation : ce que dit vraiment le RGPD →
Partager un jeu de données sans exposer d'informations personnelles : méthode en 5 étapes →
Préparer un dataset pour une publication en data-journalisme sans compromettre ses sources →