Plus les fournisseurs de soins disposent d'informations sur un patient, meilleurs sont les soins qu'ils peuvent prodiguer.
Les protocoles normalisés comme FHIR, soutenus par des réglementations nationales, facilitent la collecte de données sur les patients provenant de laboratoires, d'hôpitaux, de centres de diagnostic, etc. Toutefois, déterminer si différents enregistrements appartiennent à la même personne ou contiennent des données dupliquées peut représenter un défi. C'est le problème fondamental que la gestion des données de référence (MDM) en santé est conçue pour résoudre — et l'index maître des patients (MPI) en est le sous-système centré sur le patient, couplé à un algorithme de liage d'enregistrements approprié.
Dans cet article, nous aborderons :
- Ce que sont l'index maître des patients (MPI) et le liage d'enregistrements, et comment ils s'inscrivent dans la gestion des données de référence en santé;
- Comment mettre en œuvre un MPI et quelles méthodes peuvent être utilisées;
- Comment choisir le bon algorithme de liage d'enregistrements.
Qu'est-ce qu'un index maître des patients (MPI)?
L'index maître des patients (MPI) est un logiciel utilisé dans les organismes de santé pour identifier chaque patient de manière unique et regrouper leurs multiples enregistrements. Cela permet de s'assurer que tous les fournisseurs de soins ont accès à des informations exactes sur les patients.
Le liage d'enregistrements est le processus de mise en correspondance des enregistrements dupliqués. L'algorithme de correspondance (méthode) est au cœur de l'index maître des patients. Il calcule la similarité de deux enregistrements et détermine s'ils sont identiques.
Conseil : Si vous cherchez un outil complet pour gérer les dossiers des patients, le terme « index maître des patients » est un mot-clé utile à rechercher. Si vous vous intéressez davantage à son fonctionnement, continuez simplement à lire l'article et recherchez « liage d'enregistrements » plus tard.
Comment le MPI s'intègre dans la gestion des données de référence en santé
La gestion des données de référence (MDM) en santé est la discipline qui consiste à construire une vue unique et fiable des entités sur lesquelles repose le reste du système — patients, fournisseurs, organismes, lieux, payeurs. Chacune de ces entités a ses particularités, mais le schéma d'ingénierie est le même : ingérer à partir de nombreux systèmes sources, faire correspondre les enregistrements qui font référence à la même entité du monde réel, et résoudre les conflits en un enregistrement doré sur lequel les consommateurs en aval peuvent s'appuyer.
L'index maître des patients est la partie spécifique aux patients dans ce tableau d'ensemble. C'est de loin la tranche la plus discutée du MDM en santé, car l'identité des patients est là où les erreurs coûtent le plus cher : un enregistrement de patient dupliqué fragmente un historique clinique; un enregistrement fusionné par erreur crée un événement de sécurité. Aussi, lorsque les équipes parlent de « MPI », elles désignent presque toujours une capacité de gestion des données de référence limitée à Patient — les mêmes mécanismes de correspondance, de blocage, de fusion et d'audit que l'on utiliserait pour toute autre entité maître, simplement appliqués là où les enjeux sont les plus élevés.
Dans le reste de cet article, nous examinons comment ces mécanismes fonctionnent concrètement.
Comment fonctionne un index maître des patients
La mise en œuvre de l'index maître des patients suit un pipeline spécifique, composé de plusieurs étapes clés :
- Nettoyage et normalisation des données — nettoyer les données et standardiser leur format;
- Blocage — prégrouper les enregistrements pour réduire le nombre de comparaisons et améliorer les performances;
- Évaluation et mise en correspondance — le « cœur » du processus : identifier la similarité des enregistrements et effectuer une mise en correspondance automatique ou manuelle;
- Liage ou fusion des enregistrements dupliqués.
Examinons maintenant chaque étape plus en détail.
Index maître des patients : nettoyage et normalisation des données
En premier lieu, nous nettoyons les données.
Assurez-vous que les identificateurs (comme l'adresse, le sexe, le NAS, etc.) sont formatés de manière cohérente pour obtenir des résultats plus précis. Cela peut être accompli en supprimant la ponctuation, en convertissant en majuscules et en standardisant les valeurs.
Normalisez les terminologies : alors que le sexe peut être représenté par « Masculin/Féminin » dans un jeu de données et « Homme/Femme » dans un autre, il doit être codé de la même façon.
Si une valeur est invalide et a été saisie uniquement pour remplir un champ obligatoire (p. ex. « Bébé garçon » dans le champ Prénom ou « 00000000 » pour un numéro d'assurance sociale), il est recommandé de réinitialiser la valeur à « NULL », car l'algorithme peut être sensible à de telles entrées.

La situation idéale survient lorsque votre source de données fournit des données propres dans le même format (mêmes noms d'attributs), mais ce n'est pas toujours le cas et il faut généralement convertir vos données dans un format commun.
Nous recommandons d'utiliser HL7 FHIR pour les formats de données normalisés, car nous constatons une adoption significative de FHIR et il semble que FHIR deviendra une lingua franca pour l'échange de données en santé dans un avenir proche. Notre solution d'index maître des patients et de gestion des données de référence MDMbox est mise en œuvre sur FHIR.
Index maître des patients : blocage
Une fois les données nettoyées et normalisées, nous pouvons commencer le processus de blocage des enregistrements. Si un index maître des patients contient un million d'enregistrements, une comparaison directe de tous les enregistrements nécessiterait mille milliards de comparaisons, mais vous pouvez réduire considérablement ce nombre.
Cela implique généralement de faire passer le jeu de données à travers une série de filtres, en utilisant à chaque fois un attribut ou une méthode différente pour identifier les correspondances possibles, mais il existe un compromis entre performance et précision, et il est important de choisir la bonne clé de blocage.
Le blocage est généralement effectué en divisant les enregistrements en groupes plus petits — ou « blocs » — selon certains critères (filtres), par exemple en utilisant une similarité faible (comme le prénom, le sexe, l'année de naissance, le code postal, etc.).
Comme on peut le voir dans le schéma d'exemple ci-dessous, une opération de blocage peut générer des blocs candidats en utilisant l'attribut Nom de famille et la première lettre du Prénom, ou elle peut créer des blocs en utilisant d'autres attributs, comme le Numéro de téléphone ou le Code postal :

La mise en correspondance est ensuite effectuée à l'intérieur du bloc, ou entre deux blocs au sein du même attribut :

Il convient de noter que différentes exécutions de cette opération peuvent révéler différentes correspondances réelles, de sorte que la combinaison des résultats peut potentiellement découvrir la majorité des correspondances réelles.
L'objectif est de minimiser le nombre de candidats; les lignes directrices devraient donc être :
- Suffisamment larges pour englober tous les enregistrements pertinents dans le même bloc;
- Suffisamment spécifiques pour permettre une comparaison efficace des candidats dans un délai raisonnable.
Index maître des patients : évaluation et mise en correspondance
Le « cœur » de l'index maître des patients est le processus d'évaluation et de mise en correspondance. À cette étape, il est crucial de déterminer si deux enregistrements sont susceptibles de se rapporter au même individu. Les algorithmes peuvent classer les enregistrements en deux groupes — Correspondance ou Non-correspondance — ou dans un troisième groupe, Correspondance possible, où la décision peut être déléguée à des humains.
La mise en correspondance peut être effectuée à l'aide de différentes méthodes :
- Méthode déterministe (fondée sur des règles) — utilise un ensemble de règles (par exemple, le NAS, la date de naissance et le nom de famille correspondent) et est aussi appelée logique de correspondance exacte. Les règles déterministes peuvent être conçues avec un niveau élevé de spécificité;
- Méthode probabiliste (fondée sur un score ou Fellegi-Sunter) — cette méthode lie les enregistrements lorsque la somme de tous les accords pondérés l'emporte sur les désaccords.
Vous pouvez utiliser ce tableau pour comparer rapidement et facilement les méthodes :
| Méthode | Avantages | Inconvénients |
|---|---|---|
| Méthode déterministe (fondée sur des règles) — utilise un ensemble de règles (par exemple, le NAS, la date de naissance et le nom de famille correspondent), également appelée logique de correspondance exacte. Les règles déterministes peuvent être conçues avec un niveau élevé de spécificité | Facile à mettre en œuvre. Facile à écrire et à comprendre grâce à ses règles simples | Précision limitée ou nécessite des extensions complexes pour l'améliorer. Difficile de maintenir un ensemble de règles pour une correspondance précise. Très sensible à la qualité des données. Difficile à mettre en œuvre efficacement pour les grands jeux de données. Impossible de quantifier la qualité de l'algorithme |
| Méthode probabiliste (fondée sur un score ou Fellegi-Sunter) — cette méthode lie les enregistrements lorsque la somme de tous les accords pondérés l'emporte sur les désaccords | Utilise tous les points de données disponibles pour prendre une décision (correspondance ou non). Gère les données manquantes ou invalides. Peut apprendre à partir des statistiques de données existantes et nouvelles. La qualité de l'algorithme (précision et sensibilité) peut être estimée en chiffres. S'adapte bien au blocage pour les grands jeux de données. Utilisé avec succès pour l'analyse démographique dans de nombreux projets | Nécessite une configuration et un réglage par des experts |
MDMbox utilise la méthode probabiliste (modèle basé sur l'algorithme Fellegi-Sunter), qui est un type de classificateur bayésien, et compare les valeurs d'attributs spécifiques comme le prénom, la date de naissance ou le NAS. Si les attributs semblent identiques, cela augmente la probabilité de correspondance; si les attributs ne correspondent pas, la probabilité de correspondance diminue.

Nous utilisons donc un système qui nous aide à déterminer la probabilité que deux enregistrements soient identiques. Nous commençons par estimer la probabilité que deux enregistrements choisis au hasard correspondent. Nous comparons ensuite les enregistrements pour voir s'ils ont des éléments en commun, comme la même date de naissance, le même NAS ou le même numéro de téléphone.
Voici donc une façon simple et rapide d'expliquer le fonctionnement de l'algorithme : il compare les enregistrements et évalue avec précision les preuves, afin que nous puissions déterminer la probabilité d'une correspondance :


- Les colonnes comportant un plus grand nombre de valeurs uniques, comme la date de naissance, le NAS ou le numéro de téléphone, sont plus susceptibles d'établir une correspondance solide, car il est peu probable que ces valeurs dans deux enregistrements choisis au hasard correspondent par coïncidence.
- Lorsqu'une colonne ne correspond pas, c'est généralement une preuve contre une correspondance. Nous devons également admettre que cette preuve peut ne pas être entièrement fiable dans les cas où des facteurs externes, comme un changement de nom dû au mariage, un déménagement entraînant un code postal différent pour le patient, ou une simple faute de frappe lors de la saisie des données, peuvent entraîner une discordance dans la colonne.
Si ce score de preuve total atteint ou dépasse un seuil configurable, appelé valeur de coupure, les enregistrements sont considérés comme correspondants et peuvent être mis en correspondance. Si le score est inférieur au seuil, les enregistrements sont considérés comme des individus distincts et ne sont pas mis en correspondance dans l'index maître des patients.
Une pratique courante consiste à examiner la distribution des scores et à choisir une méthode de similarité qui produira un taux souhaité de faux positifs ou de faux négatifs. Cela peut aider à équilibrer le besoin de précision avec la nécessité de minimiser la charge de travail des réviseurs humains. Pour une démonstration pratique de cet étalonnage, consultez notre guide sur la configuration et le réglage d'un modèle de correspondance des patients.
Commencez avec le serveur FHIR Aidbox pour le stockage des données, les intégrations, l'analytique en santé et plus encore, ou engagez notre équipe pour soutenir vos besoins en développement logiciel.
Choisir l'algorithme de mise en correspondance
Comme choix par défaut, Fellegi-Sunter semble être l'option la plus appropriée. Il nécessite qu'un expert le configure, mais peut produire de bons résultats.
Si vous disposez de moins de sources de données fiables avec des relations étroites, des règles déterministes simples suffiront, mais il n'y a aucun moyen d'évaluer leur précision.
Liage ou fusion?
Après la mise en correspondance des enregistrements, il est important de décider si vous devez lier ou fusionner les enregistrements.
- Lier les enregistrements signifie que nous conservons tous les enregistrements dupliqués tels quels, mais que nous les relions les uns aux autres. Si vous disposez de différentes sources pour différents doublons, la mise à jour des enregistrements ne posera aucun problème.
Ceci est utile dans les cas où les données sont continuellement agrégées à partir de différentes sources, car cela permet à l'index maître des patients de suivre les relations entre les enregistrements sans avoir à résoudre continuellement les conflits de fusion.
- Fusionner les enregistrements signifie combiner les enregistrements en un seul enregistrement hybride.
Cela implique de combiner les données de plusieurs enregistrements en un seul enregistrement contenant toutes les informations pertinentes sur un patient. Comparé au liage, la fusion permet une récupération des données plus simple et plus rapide, ainsi qu'une utilisation plus efficace de la mémoire.
Cependant, la gestion des conflits de fusion et des liages faux positifs peut être plus complexe dans ce type de système.
Améliorez l'interopérabilité avec les solutions de santé HL7 FHIR : CapMinds FHIR Service
Le compromis du MPI : précision contre coût
Si les données sont continuellement agrégées à partir de différentes sources, une stratégie de liage semble préférable, car il n'est pas nécessaire de résoudre continuellement les conflits de fusion, tandis que les liages faux positifs pourraient simplement être annulés en déliant les enregistrements.
D'un autre côté, ce système ne traite pas uniquement d'un seul enregistrement de patient, et la plupart des interactions portent sur des ensembles d'enregistrements.
Dans les systèmes du monde réel, il est courant d'utiliser une approche hybride, combinant liage et fusion. C'est parce que le problème du compromis entre le maintien de l'intégrité des données et la possibilité de requêtes flexibles d'une part, et la création d'une image complète et précise des données d'autre part est insoluble.
L'hybridation rend l'ensemble du système plus complexe, mais conduit au résultat souhaité en fin de compte. Par exemple, un système pourrait d'abord lier les enregistrements correspondants pour créer une relation entre eux, puis fusionner les enregistrements liés en un seul enregistrement consolidé.
Alternativement, un système pourrait d'abord fusionner les enregistrements correspondants, puis lier les enregistrements consolidés résultants.
Le compromis dans le choix entre le liage et la fusion dépend des objectifs et des exigences spécifiques du système. Si l'accent est mis sur le maintien de l'intégrité des données et la possibilité de requêtes flexibles, le liage peut être préférable. Si l'accent est mis sur la création d'une image complète et précise des données, la fusion peut être préférable.
Pour expérimenter la mise en œuvre d'un index maître des patients et la mise en correspondance des enregistrements, essayez la version de développement gratuite de MDMbox. Elle offre un environnement complet pour tester ces fonctionnalités, fournissant tous les outils nécessaires sans aucune limitation.
Conclusion
Plusieurs points clés doivent être gardés à l'esprit lors de la mise en œuvre d'un index maître des patients dans le cadre de votre stratégie de gestion des données de référence en santé :
- Assurez-vous que les données utilisées sont de bonne qualité et intègres; sinon, elles doivent être nettoyées et normalisées;
- Choisissez l'algorithme le plus approprié en fonction de toutes vos exigences spécifiques au projet et de la qualité des données dont vous disposez;
- Établissez le compromis entre la fusion ou le liage des enregistrements, ou créez un système hybride;
- Traitez le MPI comme une entité à l'intérieur d'un programme de gestion des données de référence plus large — les mêmes primitives de correspondance, de fusion et d'audit s'étendent aux fournisseurs, aux organismes et aux lieux.
Notre MDMbox utilise la méthode probabiliste basée sur l'algorithme Fellegi-Sunter, car elle s'est révélée très efficace pour obtenir des résultats précis et efficients. Cet algorithme a été étudié en profondeur, optimisé pour une utilisation avec des bases de données relationnelles (SQL) et a affiché des performances exceptionnelles sur de grands jeux de données.
Dans MDMbox, les opérations de mise en correspondance et de fusion des patients s'exécutent en quelques millisecondes, même à grande échelle. La déduplication en lot est tout aussi efficace — par exemple, identifier tous les candidats dupliqués dans un jeu de données de 5 millions de patients prend environ 20 minutes. Pour un exemple concret, voyez comment nous avons trouvé des milliers d'enregistrements dupliqués dans le registre NPI en utilisant la même approche.
De plus, MDMbox fournit une interface de gestionnaire de données intégrée, permettant aux équipes de réviser et de résoudre les conflits de fusion, de gérer les doublons potentiels et de suivre les journaux d'audit complets de fusion et de défusion pour une transparence et un contrôle totaux. En savoir plus
Auteurs : Nikolai Ryzhikov, directeur technique chez Health Samurai Ivan Shukshin, ingénieur logiciel principal chez Health Samurai
Voir aussi : Enregistrements de patients dupliqués dans l'analytique en santé, Fournisseurs de MPI et sémantique de fusion $merge des patients, Données synthétiques en santé et FHIR comme format de stockage de données.







