|
11 Min. Lesezeit
|

Master Patient Index (MPI) und MDM: Funktionsweise und Beispiele

Diesen Artikel zusammenfassen mit:
ChatGPTPerplexityClaudeGrok
How many duplicates are in your patient data?

Most teams can't answer this. A 45-minute call with our engineers will get you close.

Tell us how patient records get created and move between your systems. We'll point out where duplicates usually come from in setups like yours, give a rough estimate of your duplicate rate, and say honestly whether you need an MPI. Sometimes the answer is "not yet" — we'll tell you that too.

Free · 45 minutes · you talk to an engineer, not sales

Je mehr Informationen Leistungserbringer über einen Patienten haben, desto besser ist die Versorgung, die sie bieten können.

Standardprotokolle wie FHIR, die durch nationale Vorschriften unterstützt werden, erleichtern die Sammlung von Patientendaten aus Labors, Krankenhäusern, Diagnosezentren usw. Die Identifizierung, ob verschiedene Datensätze zur selben Person gehören oder duplizierte Daten enthalten, kann jedoch eine Herausforderung darstellen. Dies ist das Kernproblem, das Healthcare Master Data Management (MDM) lösen soll — und der Master Patient Index (MPI) ist dessen patientenorientiertes Teilsystem, kombiniert mit einem geeigneten Record-Linkage-Algorithmus.

In diesem Artikel erörtern wir:

  • Was der Master Patient Index (MPI) und Record Linkage sind und wie sie in das Healthcare Master Data Management eingebettet sind;
  • Wie ein MPI implementiert wird und welche Methoden eingesetzt werden können;
  • Wie der richtige Record-Linkage-Algorithmus ausgewählt wird.

Was ist ein Master Patient Index (MPI)?

Der Master Patient Index (MPI) ist eine Software, die in Gesundheitsorganisationen eingesetzt wird, um jeden Patienten eindeutig zu identifizieren und mehrere Datensätze zu konsolidieren. Dies trägt dazu bei, dass alle Leistungserbringer Zugang zu genauen Informationen über Patienten haben.

Record Linkage ist der Prozess der Zuordnung doppelter Datensätze. Der Matching-Algorithmus (die Methode) ist das Herzstück des Master Patient Index. Er berechnet die Ähnlichkeit zweier Datensätze und entscheidet, ob sie identisch sind.

Hinweis: Wenn Sie nach einem umfassenden Werkzeug zur Verwaltung von Patientenakten suchen, ist der Begriff „Master Patient Index" ein nützliches Suchwort. Wenn Sie mehr daran interessiert sind, zu verstehen, wie es funktioniert, lesen Sie einfach weiter und suchen Sie später nach „Record Linkage".

Wie der MPI in das Healthcare Master Data Management eingebettet ist

Master Data Management (MDM) im Gesundheitswesen ist die Disziplin, eine einzige, vertrauenswürdige Sicht auf die Entitäten aufzubauen, auf die der Rest des Systems angewiesen ist — Patienten, Leistungserbringer, Organisationen, Standorte, Kostenträger. Jede dieser Entitäten hat ihre eigenen Besonderheiten, aber das technische Muster ist dasselbe: Daten aus vielen Quellsystemen aufnehmen, Datensätze, die sich auf dieselbe reale Entität beziehen, abgleichen und Konflikte in einen Golden Record auflösen, dem nachgelagerte Systeme vertrauen können.

Der Master Patient Index ist der patientenspezifische Teil dieses Bildes. Er ist bei weitem der am meisten diskutierte Bereich des Healthcare MDM, weil die Patientenidentität der Bereich ist, in dem Fehler am teuersten sind: Ein doppelter Patientendatensatz fragmentiert eine klinische Geschichte; ein falsch zusammengeführter Datensatz erzeugt ein Sicherheitsereignis. Wenn Teams also über „MPI" sprechen, meinen sie fast immer eine Master-Data-Management-Fähigkeit, die auf Patient beschränkt ist — dieselbe Matching-, Blocking-, Merge- und Audit-Maschinerie, die Sie für jede andere Master-Entität verwenden würden, nur dort angewendet, wo die Einsätze am höchsten sind.

Im weiteren Verlauf dieses Artikels betrachten wir, wie diese Maschinerie tatsächlich funktioniert.

Wie ein Master Patient Index funktioniert

Die Implementierung eines Master Patient Index folgt einer spezifischen Pipeline, die aus mehreren Schlüsselschritten besteht:

Implementing Master Patient Index
  • Datenbereinigung & Normalisierung — Daten bereinigen und ihr Format standardisieren;
  • Blocking — Datensätze vorgruppieren, um die Anzahl der Datensatzvergleiche für eine bessere Performance zu reduzieren;
  • Scoring & Matching — das „Herzstück" des Prozesses: die Ähnlichkeit von Datensätzen ermitteln und automatisches oder manuelles Matching durchführen;
  • Verknüpfen oder Zusammenführen doppelter Datensätze.

Betrachten wir nun jeden Schritt genauer.

Master Patient Index: Datenbereinigung & Normalisierung

Zunächst bereinigen wir die Daten.

Stellen Sie sicher, dass Identifikatoren (wie Adresse, Geschlecht, Sozialversicherungsnummer usw.) einheitlich formatiert sind, um am Ende genauere Ergebnisse zu erzielen. Dies kann durch das Entfernen von Satzzeichen, die Umwandlung in Großbuchstaben und die Standardisierung von Werten erreicht werden.

Terminologien normalisieren: Während Geschlecht in einem Datensatz als „Male/Female" und in einem anderen als „Man/Woman" dargestellt werden kann, sollte es einheitlich kodiert sein.

Wenn ein Wert ungültig ist und nur zur Erfüllung eines Pflichtfelds eingegeben wurde (z. B. „Baby boy" im Vornamenfeld oder „00000000" für eine Sozialversicherungsnummer), wird empfohlen, den Wert auf „NULL" zurückzusetzen, da der Algorithmus empfindlich auf solche Einträge reagieren kann.

Master Patient Index: Data Cleansing & Normalization

Die ideale Situation tritt auf, wenn Ihre Datenquelle saubere Daten im gleichen Format (gleiche Namen für Attribute) liefert, aber das ist nicht immer der Fall, und normalerweise müssen Sie Ihre Daten in dasselbe Format konvertieren.

Wir empfehlen die Verwendung von HL7 FHIR für standardisierte Datenformate, da wir eine erhebliche Akzeptanz von FHIR beobachten und es so aussieht, als würde FHIR in naher Zukunft zur Lingua franca für den Austausch von Gesundheitsdaten werden. Unsere Master Patient Index & Master Data Management-Lösung MDMbox ist auf Basis von FHIR implementiert.

Master Patient Index: Blocking

Sobald die Daten bereinigt und normalisiert wurden, können wir mit dem Blocking-Prozess beginnen. Wenn ein Master Patient Index eine Million Datensätze enthält, würde ein einfacher Vergleich aller Datensätze eine Billion Vergleiche erfordern, aber diese Zahl lässt sich erheblich reduzieren.

Dies beinhaltet in der Regel das Durchlaufen des Datensatzes durch eine Reihe von Filtern, wobei jedes Mal ein anderes Attribut oder eine andere Methode verwendet wird, um mögliche Übereinstimmungen zu identifizieren. Es gibt jedoch einen Kompromiss zwischen Performance und Genauigkeit, und es ist wichtig, den richtigen Schlüssel für das Blocking zu wählen.

Blocking wird typischerweise durchgeführt, indem die Datensätze in kleinere Gruppen — sogenannte „Blöcke" — auf Basis bestimmter Kriterien (Filter) unterteilt werden, zum Beispiel unter Verwendung schwacher Ähnlichkeit (wie Vorname, Geschlecht, Geburtsjahr, Postleitzahl usw.).

Wie im folgenden Beispielschema zu sehen ist, kann eine Blocking-Operation Kandidatenblöcke mithilfe des Attributs Nachname und des ersten Buchstabens des Vornamens erstellen, oder es könnten Blöcke mit anderen Attributen wie Telefonnummer oder Postleitzahl erstellt werden:

How Master Patient Index works

Das Matching wird dann innerhalb des Blocks oder zwischen zwei Blöcken desselben Attributs durchgeführt:

Master Patient Index: Blocking

Es ist erwähnenswert, dass verschiedene Durchläufe dieser Operation unterschiedliche wahre Übereinstimmungen aufdecken können, sodass die Kombination der Ergebnisse potenziell die Mehrheit der wahren Übereinstimmungen aufdecken kann.

Das Ziel ist es, die Anzahl der Kandidaten zu minimieren. Daher sollten die Richtlinien sein:

  • Breit genug, um alle relevanten Datensätze innerhalb desselben Blocks zu erfassen;
  • Spezifisch genug, um einen effizienten Vergleich von Kandidaten innerhalb eines angemessenen Zeitrahmens zu ermöglichen.

Master Patient Index: Scoring & Matching

Das „Herzstück" des Master Patient Index ist der Scoring- & Matching-Prozess. In diesem Schritt ist es entscheidend zu bestimmen, ob zwei Datensätze wahrscheinlich auf dieselbe Person verweisen. Algorithmen können Datensätze in zwei Gruppen einteilen — Match oder Not Match — oder eine dritte Gruppe, Possible Match, in der die Entscheidung an Menschen delegiert werden kann.

Das Matching kann mit verschiedenen Methoden durchgeführt werden:

  • Deterministische (regelbasierte) Methode — verwendet einen Satz von Regeln (z. B. Sozialversicherungsnummer, Geburtsdatum und Nachname stimmen überein) und wird auch als Exact-Match-Logik bezeichnet. Deterministische Regeln können mit einem hohen Maß an Spezifität gestaltet werden;
  • Probabilistische (scorebasierte oder Fellegi-Sunter) Methode — diese Methode verknüpft die Datensätze, wenn die Summen aller gewichteten Übereinstimmungen die Abweichungen überwiegen.

Sie können diese Tabelle verwenden, um die Methoden schnell und einfach zu vergleichen:

MethodeVorteileNachteile
Deterministische (regelbasierte) Methode: Verwendet einen Satz von Regeln (z. B. Sozialversicherungsnummer, Geburtsdatum und Nachname stimmen überein), auch Exact-Match-Logik genannt. Deterministische Regeln können mit einem hohen Maß an Spezifität gestaltet werden.Einfach zu implementieren. Einfach zu schreiben und zu verstehen dank einfacher Regeln.Begrenzte Genauigkeit oder erfordert komplizierte Erweiterungen zur Verbesserung. Schwierig, einen Regelsatz für genaues Matching zu pflegen. Sehr empfindlich gegenüber Datenqualität. Schwierig, effizient für große Datensätze zu implementieren. Keine Möglichkeit, die Qualität des Algorithmus zu quantifizieren.
Probabilistische (scorebasierte oder Fellegi-Sunter) Methode: Diese Methode verknüpft die Datensätze, wenn die Summen aller gewichteten Übereinstimmungen die Abweichungen überwiegen.Verwendet alle verfügbaren Datenpunkte für eine Entscheidung (Match oder Not Match). Verarbeitet fehlende oder ungültige Daten. Kann aus vorhandenen und neuen Datenstatistiken lernen. Qualität des Algorithmus (Genauigkeit & Sensitivität) kann in Zahlen ausgedrückt werden. Skaliert gut mit Blocking für große Datensätze. Erfolgreich für Bevölkerungsanalysen in vielen Projekten eingesetzt.Erfordert Konfiguration und Abstimmung durch Experten.

MDMbox verwendet die probabilistische Methode (Modell auf Basis des Fellegi-Sunter-Algorithmus), bei der es sich um eine Art Bayes-Klassifikator handelt, der die Werte bestimmter Attribute wie Vorname, Geburtsdatum oder Sozialversicherungsnummer vergleicht. Wenn die Attribute gleich erscheinen, erhöht dies die Matching-Wahrscheinlichkeit, und wenn die Attribute nicht übereinstimmen, sinkt die Matching-Wahrscheinlichkeit.

master patient index example

Wir verwenden also ein System, das uns hilft zu entscheiden, wie wahrscheinlich es ist, dass die beiden Datensätze identisch sind. Wir beginnen damit, abzuschätzen, wie wahrscheinlich es ist, dass zwei zufällig ausgewählte Datensätze übereinstimmen. Dann vergleichen wir die Datensätze, um zu sehen, ob sie Gemeinsamkeiten aufweisen, wie dasselbe Geburtsdatum, dieselbe Sozialversicherungsnummer oder Telefonnummer.

So lässt sich die Funktionsweise des Algorithmus kurz und einfach erklären: Er vergleicht Datensätze und bewertet die Evidenz präzise, sodass wir die Wahrscheinlichkeit einer Übereinstimmung bestimmen können:

master patient index example 2

master patient index example 3

  • Spalten mit einer größeren Anzahl eindeutiger Werte, wie Geburtsdatum, Sozialversicherungsnummer oder Telefonnummer, können mit höherer Wahrscheinlichkeit eine starke Übereinstimmung belegen, da es unwahrscheinlich ist, dass diese Werte in zwei zufällig ausgewählten Datensätzen zufällig übereinstimmen.
  • Wenn eine Spalte nicht übereinstimmt, ist dies in der Regel ein Indiz gegen eine Übereinstimmung. Wir müssen jedoch einräumen, dass diese Evidenz in Fällen, in denen externe Faktoren wie eine Namensänderung aufgrund einer Heirat, ein Umzug, der dazu führt, dass der Patient eine andere Postleitzahl hat, oder ein einfacher Tippfehler bei der Dateneingabe zu einer Nichtübereinstimmung in der Spalte führen kann, möglicherweise nicht vollständig zuverlässig ist.

Wenn dieser gesamte Evidenz-Score einen konfigurierbaren Schwellenwert, den sogenannten Cutoff-Wert, erreicht oder überschreitet, gelten die Datensätze als übereinstimmend und können zusammengeführt werden. Liegt der Score unter dem Schwellenwert, gelten die Datensätze als unterschiedliche Personen und werden im Master Patient Index nicht zusammengeführt.

Eine gängige Praxis besteht darin, die Verteilung der Scores zu untersuchen und eine Ähnlichkeitsmethode zu wählen, die zu einer gewünschten Rate von falsch positiven oder falsch negativen Ergebnissen führt. Dies kann dazu beitragen, den Bedarf an Genauigkeit mit dem Bedarf, den Arbeitsaufwand für menschliche Prüfer zu minimieren, in Einklang zu bringen. Eine praxisnahe Anleitung zu dieser Kalibrierung finden Sie in unserem Leitfaden zur Konfiguration und Abstimmung eines Patient-Matching-Modells.

Starten Sie mit dem Aidbox FHIR Server für Datenspeicherung, Integrationen, Healthcare-Analytics und mehr, oder beauftragen Sie unser Team, um Ihre Softwareentwicklungsanforderungen zu unterstützen.

Den richtigen Matching-Algorithmus auswählen

Als Standardwahl erscheint Fellegi-Sunter als die am besten geeignete Option. Es erfordert einen Experten für Einrichtung und Konfiguration, kann aber ein gutes Ergebnis liefern.

Wenn Sie weniger vertrauenswürdige Datenquellen mit engen Beziehungen haben, werden einfache deterministische Regeln ausreichen, es gibt jedoch keine Möglichkeit, ihre Genauigkeit zu bewerten.

Verknüpfen oder Zusammenführen?

Nachdem die Datensätze abgeglichen wurden, ist es wichtig zu entscheiden, ob Sie die Datensätze verknüpfen oder zusammenführen sollen.

  • Datensätze verknüpfen bedeutet, dass wir alle doppelten Datensätze so belassen, wie sie sind, aber sie miteinander verknüpfen. Wenn Sie verschiedene Quellen für verschiedene Duplikate haben, gibt es kein Problem bei der Aktualisierung der Datensätze.

Dies ist in Fällen nützlich, in denen Daten kontinuierlich aus verschiedenen Quellen aggregiert werden, da es dem Master Patient Index ermöglicht, die Beziehungen zwischen Datensätzen zu verfolgen, ohne kontinuierlich Merge-Konflikte lösen zu müssen.

  • Datensätze zusammenführen bedeutet die Kombination der Datensätze zu einem einzigen, hybriden Datensatz.

Dies beinhaltet die Kombination der Daten aus mehreren Datensätzen in einem einzigen Datensatz, der alle relevanten Informationen über einen Patienten enthält. Im Vergleich zur Verknüpfung ermöglicht das Zusammenführen eine einfachere und schnellere Datenabfrage sowie eine effizientere Speichernutzung.

Die Verwaltung von Merge-Konflikten und falsch positiven Verknüpfungen kann in diesem Systemtyp jedoch komplexer sein.

Verbessern Sie die Interoperabilität mit HL7 FHIR-Gesundheitslösungen: CapMinds FHIR Service

Der MPI-Kompromiss: Genauigkeit vs. Kosten

Wenn Daten kontinuierlich aus verschiedenen Quellen aggregiert werden, erscheint eine Verknüpfungsstrategie vorzuziehen, da keine kontinuierliche Auflösung von Merge-Konflikten erforderlich ist, während falsch positive Verknüpfungen einfach durch Aufhebung der Verknüpfung rückgängig gemacht werden können.

Andererseits hat dieses System nicht nur mit einem einzigen Patientendatensatz zu tun, und die meisten Interaktionen betreffen Sätze von Datensätzen.

In realen Systemen ist es üblich, einen hybriden Ansatz zu verwenden, der sowohl Verknüpfung als auch Zusammenführung kombiniert. Dies liegt daran, dass das Problem des Kompromisses zwischen Aufrechterhaltung der Datenintegrität & Ermöglichung flexibler Abfragen einerseits und Schaffung eines vollständigen & genauen Bildes der Daten andererseits unlösbar ist.

Die Hybridisierung macht das Gesamtsystem komplizierter, führt aber letztendlich zum gewünschten Ergebnis. Ein System könnte zum Beispiel zunächst übereinstimmende Datensätze verknüpfen, um eine Beziehung zwischen ihnen herzustellen, und dann die verknüpften Datensätze in einem einzigen, konsolidierten Datensatz zusammenführen.

Alternativ könnte ein System übereinstimmende Datensätze zuerst zusammenführen und dann die resultierenden konsolidierten Datensätze verknüpfen.

Der Kompromiss bei der Wahl zwischen Verknüpfen und Zusammenführen hängt von den spezifischen Zielen und Anforderungen des Systems ab. Wenn der Fokus auf der Aufrechterhaltung der Datenintegrität und der Ermöglichung flexibler Abfragen liegt, ist die Verknüpfung möglicherweise vorzuziehen. Wenn der Fokus auf der Schaffung eines vollständigen und genauen Bildes der Daten liegt, ist das Zusammenführen möglicherweise vorzuziehen.

Um die Implementierung eines Master Patient Index und das Record Matching auszuprobieren, testen Sie die kostenlose Entwicklungsversion von MDMbox. Sie bietet eine vollständige Umgebung zum Testen dieser Funktionalitäten und stellt alle notwendigen Werkzeuge ohne Einschränkungen bereit.

Fazit

Bei der Implementierung eines Master Patient Index als Teil Ihrer Healthcare-Master-Data-Management-Strategie sind mehrere wichtige Punkte zu beachten:

  • Stellen Sie sicher, dass die verwendeten Daten von guter Qualität und Integrität sind, andernfalls sollten sie bereinigt und normalisiert werden;
  • Wählen Sie den am besten geeigneten Algorithmus basierend auf allen Ihren spezifischen Projektanforderungen und der Qualität der vorhandenen Daten;
  • Legen Sie den Kompromiss zwischen dem Zusammenführen oder Verknüpfen von Datensätzen fest oder erstellen Sie ein hybrides System;
  • Behandeln Sie den MPI als eine Entität innerhalb eines umfassenderen Master-Data-Management-Programms — dieselben Matching-, Merge- und Audit-Primitive erstrecken sich auf Leistungserbringer, Organisationen und Standorte.

Unser MDMbox verwendet die probabilistische Methode basierend auf dem Fellegi-Sunter-Algorithmus, da diese sich als äußerst effektiv bei der Erzielung genauer und effizienter Ergebnisse erwiesen hat. Dieser Algorithmus wurde umfassend untersucht, für die Verwendung mit relationalen Datenbanken (SQL) optimiert und hat bei großen Datensätzen außergewöhnlich gut abgeschnitten.

In MDMbox werden Patient-Matching- und Merge-Operationen in Millisekunden ausgeführt, selbst in großem Maßstab. Die Bulk-Deduplizierung ist ebenso effizient — zum Beispiel dauert die Identifizierung aller doppelten Kandidaten in einem Datensatz mit 5 Millionen Patienten etwa 20 Minuten. Ein reales Beispiel finden Sie in unserem Bericht darüber, wie wir mit demselben Ansatz Tausende von doppelten Datensätzen im NPI-Register gefunden haben.

Darüber hinaus bietet MDMbox eine integrierte Data-Steward-Benutzeroberfläche, die es Teams ermöglicht, Merge-Konflikte zu prüfen und zu lösen, potenzielle Duplikate zu verwalten und vollständige Merge- und Unmerge-Audit-Protokolle für vollständige Transparenz und Kontrolle nachzuverfolgen. Mehr erfahren

Autoren: Nikolai Ryzhikov, CTO bei Health Samurai Ivan Shukshin, Lead Software Engineer bei Health Samurai

Master Patient Index module

Siehe auch: Doppelte Patientendatensätze in der Healthcare-Analytics, MPI-Anbieter und Patient-$merge-Semantik, Synthetische Daten im Gesundheitswesen und FHIR als Ihr Datenspeicherformat.

Diesen Artikel teilen
Comments
Comments
Sign in
Loading comments...
Subscribe to our blog

Get the latest articles on FHIR, interoperability, and healthcare IT.