Mis à jour le 7 min de lecture

Des données de santé « anonymisées » peuvent-elles encore vous identifier ?

« Ne vous inquiétez pas, les données sont anonymisées. » Quiconque partage des données de santé a entendu cette phrase. Le mécanisme derrière elle est plus faible qu’il n’y paraît.

Comment l’anonymisation est censée fonctionner

Sous HIPAA, le mécanisme central pour permettre la recherche sur les dossiers de santé est la désidentification : retirer les 18 identifiants listés (noms, adresses plus fines que l’État, presque toutes les dates, numéros d’identification, etc.), ou faire certifier par un expert que le risque de réidentification est « très faible », et le dossier cesse d’être une information de santé protégée. Il peut alors être partagé sans l’autorisation du patient. L’hypothèse : sans identifiants, le dossier ne renvoie plus à une personne.

La même hypothèse, inscrite dans la loi française

La France l’écrit dans un texte. L’article L1461-2 du code de la santé publique exige que les données du système national des données de santé mises à la disposition du public soient traitées pour prendre la forme de statistiques agrégées, ou de données individuelles constituées de telle sorte que l’identification, directe ou indirecte, des personnes concernées y est impossible. Leur réutilisation ne peut avoir ni pour objet ni pour effet d’identifier ces personnes, et elles sont mises à disposition gratuitement.

Les deux branches ne se valent pas, alors que l’article les présente comme des alternatives. Un agrégat écarte réellement l’individu : un effectif, un taux ou une moyenne sur un groupe assez large ne décrit personne en particulier. Une donnée qui reste individuelle décrit encore une personne, et ce qui la rend réidentifiable n’est pas l’identifiant retiré mais la combinaison de ce qui subsiste. La première branche peut tenir ce que l’article demande. Savoir si la seconde le peut est la question que traite la suite de cette page.

Pourquoi cela échoue

Retirer les identifiants directs ne suffit pas. Une revue systématique des attaques de réidentification a trouvé qu’en moyenne environ un quart des dossiers étaient réidentifiés, un tiers dans les attaques sur des données de santé, presque toujours dans des jeux de données seulement débarrassés des noms et autres identifiants directs, et non désidentifiés selon une norme formelle. Des travaux ultérieurs ont montré que 15 attributs démographiques suffisent à réidentifier 99,98 % des Américains. Une date de naissance ici, un code postal là, un diagnostic rare, une date d’admission : aucun n’est un nom, mais ensemble ils peuvent réduire un dossier à une seule personne.

Aux États-Unis, les violations d’informations de santé protégées signalées au régulateur fédéral depuis 2009 avaient, fin 2025, exposé les dossiers de plus d’un milliard de personnes (chaque personne est comptée une fois par violation, le total n’est donc pas un nombre de personnes distinctes). Une fois qu’un jeu de données « anonymisé » fuite, quiconque détient d’autres données sur vous peut tenter la combinaison.

Ce que les autorités françaises ont effectivement constaté

Deux décisions françaises de 2026 ont éprouvé directement cette affirmation, et toutes deux l’ont écartée.

En février 2026, le Conseil d’État a confirmé trois amendes de la CNIL contre des sociétés du groupe Cegedim, qui exploitaient deux bases alimentées par des logiciels de cabinets médicaux et d’officines : 13,4 millions de consultations associées à 4 millions de codes patients, et environ 78 millions d’identifiants clients provenant de 8 500 pharmacies. Les sociétés soutenaient qu’un code patient rendait les données anonymes. Le Conseil d’État a énoncé le critère. Une donnée n’est réputée anonymisée par pseudonymisation que si le risque d’identification est insignifiant, une telle identification étant irréalisable en pratique, notamment parce qu’elle impliquerait un effort démesuré en temps, en coût et en main d’œuvre. En l’espèce, elle était réalisable. À côté du code figuraient l’âge, le sexe, la catégorie socio-professionnelle, les pathologies, les prescriptions, les arrêts de travail, les vaccinations, la date et parfois l’heure exacte de chaque visite, ainsi que les identifiants ADELI ou RPPS du prescripteur, qu’un moteur de recherche public transforme en un nom. La CNIL avait individualisé des patients avec un tableur d’usage courant et la nomenclature de codes fournie par les sociétés elles-mêmes, en peu de temps et avec peu de moyens.

Trois mois plus tard, la CNIL a infligé à IQVIA une amende de cinq millions d’euros au titre de deux entrepôts de données de santé autorisés, l’un alimenté par environ 14 000 pharmacies, l’autre par plusieurs milliers de médecins. IQVIA soutenait que les données étaient anonymes. La CNIL a jugé qu’elles étaient pseudonymes, car chaque patient portait un identifiant unique qui suivait son parcours de soins, les dossiers allaient jusqu’à la situation matrimoniale, au nombre d’enfants, au diagnostic, aux symptômes, aux allergies, au poids, à la taille, au pouls, aux vaccins et aux arrêts de travail, et ces données pouvaient être croisées avec des données publiquement accessibles.

Les deux décisions reposent sur ce que cette page soutient. Ce qui rend un dossier réidentifiable n’est pas l’identifiant retiré, mais la combinaison de ce qui subsiste.

Le compromis

La réponse classique au risque de réidentification consiste à retirer davantage : dates plus grossières, régions plus larges, moins de champs. Mais chaque champ retiré retire aussi de la valeur scientifique, et la réponse institutionnelle habituelle, durcir les règles et les contrôles d’accès, a ralenti la recherche sans améliorer clairement la confidentialité : deux tiers des épidémiologistes américains interrogés jugeaient que la règle de confidentialité HIPAA avait rendu la recherche plus difficile, un quart seulement qu’elle avait renforcé la confidentialité des participants, et la loi finlandaise sur l’utilisation secondaire a été suivie d’une baisse estimée à 47 % des nouveaux permis de données en 2023. On demande à un seul mécanisme de fournir à la fois la confidentialité et la valeur de recherche ; il ne fournit pleinement ni l’une ni l’autre.

L’alternative : le consentement plutôt que l’anonymisation

Il existe une autre façon de rendre les données de santé utilisables pour la recherche : ne pas prétendre qu’elles ne sont pas personnelles. Garder le dossier entier, sous le contrôle de la personne, et faire passer la recherche par un consentement explicite et révocable, avec chaque accès journalisé.

Health Data Safe est construite ainsi : les données restent sous le contrôle du patient sur une infrastructure open source, l’accès d’un chercheur exige un consentement limité dans le temps et lié à une finalité, et chaque accès est journalisé avec l’identité de l’accédant et le périmètre consulté. Rien n’est retiré du dossier, qui garde toute sa valeur scientifique ; la protection vient de la gouvernance.

Voir Fonctionnement pour la mécanique, ou les lois qui protègent les données de santé en Europe. Les dispositions françaises citées ci-dessus figurent dans leur contexte sur la page du droit des données de santé en France.

Sources