Diagnostische Tests: Sensitivität, Spezifität und prädiktive Werte

Zusammenfassung

Die Sensitivität gibt die Wahrscheinlichkeit eines positiven Testergebnisses bei Personen an, die die Zielerkrankung haben, die Spezifität die Wahrscheinlichkeit eines negativen Testergebnisses bei Personen, die sie nicht haben. Der positive und der negative prädiktive Wert beantworten die klinische Frage: Wie wahrscheinlich ist es, dass der Patient nach einem positiven bzw. negativen Test die Erkrankung hat bzw. nicht hat? Prädiktive Werte hängen stark von der Vortestwahrscheinlichkeit ab. Ein positiver Test kann daher bei Testung einer Niedrigrisikopopulation einen niedrigen prädiktiven Wert haben, auch wenn Sensitivität und Spezifität hoch sind [1,2].

Likelihood-Quotienten sind oft am besten geeignet, ein Testergebnis auf einen einzelnen Patienten zu übertragen. Die Vortest-Odds werden mit dem Likelihood-Quotienten des Testergebnisses multipliziert und ergeben die Nachtest-Odds. Das Ergebnis wird anschließend nach dem Satz von Bayes in eine Nachtestwahrscheinlichkeit umgerechnet [3,4]. Ein Test sollte nur angefordert werden, wenn das Ergebnis die Wahrscheinlichkeit über eine Schwelle für Behandlung oder weitere Diagnostik heben oder unter eine Schwelle senken kann, ab der die Erkrankung ausgeschlossen werden kann.

Sensitivität und Spezifität sind keine unveränderlichen Laboreigenschaften. Sie variieren mit dem gewählten Grenzwert, dem Schweregrad der Erkrankung, der Patientenauswahl, dem klinischen Setting, der Testdurchführung und dem Referenzstandard. Ergebnisse diagnostischer Studien müssen daher sowohl hinsichtlich des Verzerrungsrisikos als auch der Übertragbarkeit auf die eigene Population beurteilt werden. Ein sicherer diagnostischer Einsatz erfordert, dass man das gesamte Paar aus Sensitivität und Spezifität, die Konfidenzintervalle, die Patientenpopulation, den Referenzstandard, den Umgang mit nicht eindeutigen Ergebnissen und die vorgesehene Rolle des Tests prüft.

Grundbegriffe

Zielerkrankung, Indextest und Referenzstandard

Eine Studie zur diagnostischen Genauigkeit vergleicht einen Indextest, also den untersuchten Test, mit einem Referenzstandard, d. h. der Methode, mit der festgestellt wird, ob die Zielerkrankung tatsächlich vorliegt. Die Zielerkrankung kann eine Krankheit, ein Stadium, eine anatomische Veränderung oder ein anderer klinisch relevanter Zustand sein.

Der Begriff diagnostischer Test umfasst mehr als Laboranalysen. Symptome, Untersuchungsbefunde, Bildgebung, Histopathologie, Mikrobiologie, physiologische Untersuchungen, klinische Scores und Algorithmen können alle als Indextest evaluiert werden.

Die vorgesehene Rolle des Tests muss festgelegt werden, bevor die Genauigkeit interpretiert wird:

  • Screeningtest: wird bei Personen ohne bekannte Erkrankung eingesetzt.
  • Triagetest: entscheidet, wer einen aufwendigeren oder invasiveren Test benötigt.
  • Zusatztest: wird nach der bisherigen Diagnostik eingesetzt, um die Klassifikation zu verbessern.
  • Ersatztest: soll einen etablierten Test ersetzen.
  • Bestätigungstest: dient vor allem der Bestätigung einer Verdachtsdiagnose.
  • Ausschlusstest: dient vor allem dazu, die Wahrscheinlichkeit auf ein akzeptables Niveau zu senken.

Die klinische Rolle bestimmt, welche Fehler am schwerwiegendsten sind. Ein Triagetest, der eine gefährliche Erkrankung ausschließen soll, benötigt in der Regel eine sehr hohe Sensitivität, während ein Test, der zu einer risikobehafteten Behandlung oder Operation führt, oft eine hohe Spezifität benötigt [5].

Die Vierfeldertafel

Werden sowohl Indextest als auch Referenzstandard als positiv oder negativ klassifiziert, ergeben sich vier mögliche Konstellationen.

Zielerkrankung vorhanden Zielerkrankung nicht vorhanden
Test positiv Richtig positiv, RP Falsch positiv, FP
Test negativ Falsch negativ, FN Richtig negativ, RN

Sensitivität und Spezifität werden in der Tafel vertikal berechnet, innerhalb der Gruppen mit bzw. ohne Zielerkrankung. Prädiktive Werte werden horizontal berechnet, innerhalb der Gruppen mit positivem bzw. negativem Test.

Zentrale Maße und Formeln

Maß Formel Klinische Interpretation
Sensitivität RP / (RP + FN) Anteil der Erkrankten mit positivem Test
Spezifität RN / (RN + FP) Anteil der Nichterkrankten mit negativem Test
Falsch-negativ-Rate FN / (RP + FN) 1 minus Sensitivität
Falsch-positiv-Rate FP / (RN + FP) 1 minus Spezifität
Positiver prädiktiver Wert, PPV RP / (RP + FP) Wahrscheinlichkeit der Erkrankung nach positivem Test
Negativer prädiktiver Wert, NPV RN / (RN + FN) Wahrscheinlichkeit für das Fehlen der Erkrankung nach negativem Test
Positiver Likelihood-Quotient, LR+ Sensitivität / (1 minus Spezifität) Wie stark ein positiver Test die Odds erhöht
Negativer Likelihood-Quotient, LR− (1 minus Sensitivität) / Spezifität Wie stark ein negativer Test die Odds senkt
Gesamtanteil korrekter Klassifikationen (RP + RN) / alle Anteil korrekt Klassifizierter in der untersuchten Population
Diagnostische Odds Ratio LR+ / LR− Zusammenfassendes Diskriminationsmaß, verdeckt aber das Verhältnis zwischen Sensitivität und Spezifität

Der Gesamtanteil korrekter Klassifikationen kann irreführend sein. Tritt eine Erkrankung bei 1 Prozent der Population auf, erreicht die Strategie, alle als gesund einzustufen, 99 Prozent korrekte Klassifikation, obwohl kein einziger Krankheitsfall erkannt wird. Das Maß sollte daher die Angabe von Sensitivität und Spezifität nicht ersetzen.

Sensitivität und Spezifität

Sensitivität

Die Sensitivität ist die Wahrscheinlichkeit eines positiven Tests unter der Bedingung, dass die Zielerkrankung vorliegt:

Sensitivität = P(Test positiv | Zielerkrankung vorhanden)

Ein Test mit 95 Prozent Sensitivität ergibt in der untersuchten Population und beim jeweiligen Grenzwert bei 5 Prozent der Personen mit Zielerkrankung ein negatives Ergebnis.

Eine hohe Sensitivität ist besonders wichtig, wenn:

  • eine übersehene Erkrankung schweren Schaden verursachen kann
  • eine wirksame frühe Behandlung verfügbar ist
  • der Test als erste Triage vor der definitiven Diagnostik eingesetzt wird
  • ein negatives Ergebnis die Diagnostik beenden oder vereinfachen können soll.

Die klinische Konsequenz eines negativen Tests hängt jedoch nicht allein von der Sensitivität ab. Spezifität und Vortestwahrscheinlichkeit beeinflussen LR− und damit die verbleibende Nachtestwahrscheinlichkeit. Die Merkregel, dass ein negativer hochsensitiver Test eine Erkrankung ausschließt, gilt nur, wenn die Sensitivität in der jeweiligen Population ausreichend hoch ist und die Nachtestwahrscheinlichkeit tatsächlich unter der klinischen Ausschlussschwelle liegt [1,4].

Spezifität

Die Spezifität ist die Wahrscheinlichkeit eines negativen Tests unter der Bedingung, dass die Zielerkrankung nicht vorliegt:

Spezifität = P(Test negativ | Zielerkrankung nicht vorhanden)

Ein Test mit 90 Prozent Spezifität ergibt bei 10 Prozent der Personen ohne Zielerkrankung ein positives Ergebnis.

Eine hohe Spezifität ist besonders wichtig, wenn:

  • ein positives Ergebnis zu einer risikobehafteten oder kostspieligen Behandlung führt
  • die Diagnose erhebliche psychische, soziale oder versicherungsrechtliche Folgen hat
  • der Test zur Bestätigung einer Diagnose nach einem sensitiven Triagetest eingesetzt wird
  • falsch positive Ergebnisse eine invasive weiterführende Diagnostik nach sich ziehen.

Ein positiver hochspezifischer Test kann die Diagnose stark stützen, allerdings nur, wenn der positive Likelihood-Quotient ausreichend groß ist und der Test im richtigen klinischen Kontext eingesetzt wird.

Sensitivität und Spezifität müssen gemeinsam berichtet werden

Sensitivität und Spezifität bilden ein Paar. Ein Test lässt sich nicht anhand nur eines dieser Maße bewerten. Ein Labortest mit niedrigem Grenzwert kann beispielsweise eine hohe Sensitivität, aber eine niedrige Spezifität aufweisen. Wird der Grenzwert angehoben, sinkt in der Regel die Sensitivität, während die Spezifität steigt.

Es ist daher unzureichend, einen Test etwa als zu 95 Prozent korrekt zu beschreiben, ohne Folgendes anzugeben:

  • gewählter Grenzwert
  • Sensitivität
  • Spezifität
  • Konfidenzintervalle
  • Patientenpopulation
  • Referenzstandard
  • Anteil nicht eindeutiger oder fehlender Ergebnisse.

Diagnostische Maße reagieren zudem empfindlich auf das Studiendesign. Studien, die eindeutig erkrankte Patienten mit gesunden Kontrollen vergleichen, ergeben oft eine höhere Genauigkeit als Studien an konsekutiven Patienten mit realistischer diagnostischer Unsicherheit [2,6].

Prädiktive Werte und Vortestwahrscheinlichkeit

Positiver prädiktiver Wert

Der PPV ist die Wahrscheinlichkeit, dass die Zielerkrankung nach einem positiven Test vorliegt:

PPV = P(Zielerkrankung vorhanden | Test positiv)

Er darf nicht mit der Sensitivität verwechselt werden. Die Sensitivität geht von Personen aus, die bereits als erkrankt klassifiziert sind. Der PPV geht von Personen mit positivem Test aus und fragt, wie viele von ihnen die Erkrankung tatsächlich haben.

Negativer prädiktiver Wert

Der NPV ist die Wahrscheinlichkeit, dass die Zielerkrankung nach einem negativen Test nicht vorliegt:

NPV = P(Zielerkrankung nicht vorhanden | Test negativ)

Auch dies ist im Vergleich zur Spezifität eine umgekehrte bedingte Wahrscheinlichkeit. Eine hohe Spezifität bedeutet nicht automatisch einen hohen NPV.

Prävalenz und klinische Wahrscheinlichkeit

Prädiktive Werte hängen vom Anteil der Personen mit Zielerkrankung in der getesteten Population ab. Steigt die Vortestwahrscheinlichkeit:

  • steigt der PPV
  • sinkt der NPV.

Sinkt die Vortestwahrscheinlichkeit:

  • sinkt der PPV
  • steigt der NPV.

Die Prävalenz in einer diagnostischen Studie kann nur dann als Vortestwahrscheinlichkeit verwendet werden, wenn die Studienpopulation der Population entspricht, in der der Test eingesetzt werden soll. Für den einzelnen Patienten sollte die Vortestwahrscheinlichkeit auf relevanten klinischen Informationen beruhen, etwa Symptomen, Untersuchungsbefunden, Risikofaktoren, früheren Testergebnissen und Versorgungsstufe [3].

Rechenbeispiel

Angenommen sei ein Test mit:

  • Sensitivität 90 Prozent
  • Spezifität 90 Prozent
  • Vortestwahrscheinlichkeit 10 Prozent
  • 1 000 getesteten Personen.
Ergebnis Anzahl
Richtig positiv 90
Falsch negativ 10
Richtig negativ 810
Falsch positiv 90

Der PPV beträgt:

90 / (90 + 90) = 50 Prozent

Der NPV beträgt:

810 / (810 + 10) = 98,8 Prozent

Trotz 90 Prozent Sensitivität und 90 Prozent Spezifität hat nur die Hälfte der Personen mit positivem Test die Zielerkrankung.

Wird derselbe Test in einer Population mit 1 Prozent Vortestwahrscheinlichkeit eingesetzt, ergeben sich unter 10 000 Personen:

  • 90 richtig positive
  • 10 falsch negative
  • 990 falsch positive
  • 8 910 richtig negative.

Der PPV beträgt dann:

90 / (90 + 990) = 8,3 Prozent

Das positive Ergebnis ist also häufiger falsch als richtig. Das Beispiel zeigt, warum breite Testung von Niedrigrisikopersonen viele falsch positive Befunde erzeugen kann, selbst wenn die Spezifität des Tests hoch erscheint.

Likelihood-Quotienten und Satz von Bayes

Likelihood-Quotienten

Der Likelihood-Quotient gibt an, um wie viel wahrscheinlicher ein bestimmtes Testergebnis bei einer Person mit Zielerkrankung ist als bei einer Person ohne.

Für einen binären Test gilt:

LR+ = Sensitivität / (1 minus Spezifität)

LR− = (1 minus Sensitivität) / Spezifität

LR+ sollte möglichst groß sein, LR− möglichst nahe bei null.

Likelihood-Quotient Typischer Einfluss auf die Wahrscheinlichkeit
LR+ über 10 Starke Zunahme
LR+ 5 bis 10 Mäßige Zunahme
LR+ 2 bis 5 Geringe Zunahme
LR+ nahe 1 Minimale diagnostische Information
LR− 0,5 bis 1 Minimale oder geringe Abnahme
LR− 0,2 bis 0,5 Geringe Abnahme
LR− 0,1 bis 0,2 Mäßige Abnahme
LR− unter 0,1 Starke Abnahme

Die Grenzen sind didaktische Faustregeln, keine universellen klinischen Kriterien. Wie groß die Veränderung sein muss, hängt von der Ausgangswahrscheinlichkeit und den Entscheidungen ab, die der Test steuern soll.

Von der Vortest- zur Nachtestwahrscheinlichkeit

Der Satz von Bayes lässt sich in drei Schritten anwenden:

  1. Vortestwahrscheinlichkeit in Vortest-Odds umrechnen.
  2. Vortest-Odds mit dem relevanten Likelihood-Quotienten multiplizieren.
  3. Nachtest-Odds in Nachtestwahrscheinlichkeit umrechnen.

Formeln:

Vortest-Odds = Vortestwahrscheinlichkeit / (1 minus Vortestwahrscheinlichkeit)

Nachtest-Odds = Vortest-Odds × Likelihood-Quotient

Nachtestwahrscheinlichkeit = Nachtest-Odds / (1 + Nachtest-Odds)

Für den Test aus dem vorigen Beispiel:

  • Sensitivität 0,90
  • Spezifität 0,90
  • LR+ = 0,90 / 0,10 = 9
  • LR− = 0,10 / 0,90 = 0,11.

Bei 10 Prozent Vortestwahrscheinlichkeit betragen die Vortest-Odds 0,10 / 0,90 = 0,111.

Nach positivem Test:

  • Nachtest-Odds = 0,111 × 9 = 1
  • Nachtestwahrscheinlichkeit = 1 / 2 = 50 Prozent.

Nach negativem Test:

  • Nachtest-Odds = 0,111 × 0,11 = 0,0123
  • die Nachtestwahrscheinlichkeit beträgt etwa 1,2 Prozent.

Die Ergebnisse entsprechen dem PPV und dem Komplement des NPV in der Vierfeldertafel. Likelihood-Quotienten sind besonders praktisch, weil sich dieselben Testeigenschaften mit unterschiedlichen Vortestwahrscheinlichkeiten kombinieren lassen [3,4].

Mehrstufige Tests und intervallspezifische Likelihood-Quotienten

Die Dichotomisierung kontinuierlicher Testergebnisse in positiv oder negativ führt zu Informationsverlust. Ein Wert weit über dem Grenzwert erhöht die Wahrscheinlichkeit oft stärker als ein grenzwertnaher Wert. Entsprechend kann ein sehr niedriger Wert die Wahrscheinlichkeit stärker senken als ein knapp negatives Ergebnis.

Wenn Daten vorliegen, sollten kontinuierliche oder ordinale Tests in klinisch relevante Intervalle unterteilt werden, mit einem Likelihood-Quotienten für jedes Intervall. Dies ist oft aussagekräftiger als ein einzelner Grenzwert und wird bei der kritischen Berichterstattung über diagnostische Tests empfohlen [4].

Mehrere Tests nacheinander

Bei sequenzieller Testung wird die Nachtestwahrscheinlichkeit nach dem ersten Test zur Vortestwahrscheinlichkeit für den nächsten. Likelihood-Quotienten dürfen nur dann multipliziert werden, wenn die Testergebnisse bei gegebenem Krankheitsstatus hinreichend unabhängig sind. Messen zwei Tests dasselbe biologische Phänomen, können ihre Fehler korreliert sein. Eine einfache Multiplikation läuft dann Gefahr, die Evidenz zu überschätzen.

In der Praxis sollte man:

  • die Wahrscheinlichkeit nach jedem bedeutsamen Ergebnis aktualisieren
  • berücksichtigen, ob die Tests dasselbe oder unterschiedliche Phänomene messen
  • vermeiden, mehrere eng verwandte Befunde als unabhängige Belege zu behandeln
  • validierte diagnostische Algorithmen verwenden, wenn solche vorhanden sind.

Grenzwerte und ROC-Kurven

Wahl des Grenzwerts

Bei einem kontinuierlichen Test muss ein Grenzwert festgelegt werden, ab dem das Ergebnis als positiv gilt. Sprechen höhere Werte für die Zielerkrankung, führt ein gesenkter Grenzwert in der Regel zu:

  • höherer Sensitivität
  • niedrigerer Spezifität
  • mehr falsch positiven Ergebnissen
  • weniger falsch negativen Ergebnissen.

Ein angehobener Grenzwert hat den gegenteiligen Effekt.

Der diagnostische Entscheidungsgrenzwert ist nicht notwendigerweise identisch mit dem Referenzbereich des Labors. Ein Referenzbereich beschreibt in der Regel die Verteilung in einer Referenzpopulation. Ein klinischer Entscheidungsgrenzwert wird gewählt, um zwischen Handlungsoptionen zu unterscheiden, und muss für diesen Zweck validiert werden [1].

Die ROC-Kurve

Eine ROC-Kurve stellt die Sensitivität auf der vertikalen Achse gegen die Falsch-positiv-Rate, also 1 minus Spezifität, auf der horizontalen Achse für alle möglichen Grenzwerte dar [5].

Die Kurve kann verwendet werden, um:

  • den Zielkonflikt zwischen Sensitivität und Spezifität zu beschreiben
  • die Diskriminationsfähigkeit des Tests bei verschiedenen Grenzwerten zu vergleichen
  • mögliche Grenzwerte zu identifizieren
  • Tests zu vergleichen, sofern der Vergleich korrekt angelegt ist.

Die Fläche unter der ROC-Kurve

Die AUC lässt sich als Wahrscheinlichkeit interpretieren, dass eine zufällig ausgewählte Person mit Zielerkrankung einen auffälligeren Testwert aufweist als eine zufällig ausgewählte Person ohne die Erkrankung. Eine AUC von 0,5 entspricht keiner Diskrimination, 1,0 einer perfekten Rangordnung [5].

Die AUC hat wichtige Einschränkungen:

  • Sie gibt nicht die Sensitivität oder Spezifität am klinisch verwendeten Grenzwert an.
  • Sie gewichtet Abschnitte der ROC-Kurve, die klinisch irrelevant sein können.
  • Zwei Tests können dieselbe AUC, aber im relevanten Bereich eine völlig unterschiedliche Leistung haben.
  • Die AUC sagt nichts direkt über Kalibrierung, prädiktive Werte oder klinischen Nutzen aus.
  • Eine hohe AUC garantiert nicht, dass ein brauchbarer Entscheidungsschwellenwert existiert.

Untersuchungen zu ROC-Analysen haben häufige Probleme aufgezeigt: fehlende Konfidenzintervalle, unzureichende Vergleiche zwischen Tests und fehlerhafte Analyse gepaarter Daten [6]. Der Grenzwert sollte möglichst vorab auf Grundlage klinischer Konsequenzen oder externer Evidenz festgelegt werden. Wird er im selben Datensatz gewählt, um beispielsweise die Summe aus Sensitivität und Spezifität zu maximieren, ist das Ergebnis zu optimistisch und erfordert eine externe Validierung [7].

Von Testeigenschaften zur klinischen Entscheidung

Testschwelle und Behandlungsschwelle

Das diagnostische Vorgehen lässt sich in drei Wahrscheinlichkeitsbereiche gliedern:

  1. Unterhalb der Testschwelle ist die Zielerkrankung so unwahrscheinlich, dass weitere Tests nicht gerechtfertigt sind.
  2. Zwischen Testschwelle und Behandlungsschwelle kann ein Test das Vorgehen ändern.
  3. Oberhalb der Behandlungsschwelle ist die Wahrscheinlichkeit so hoch, dass eine Behandlung oder andere gezielte Maßnahme ohne weitere Tests gerechtfertigt sein kann, sofern die Risiken der Maßnahme akzeptabel sind.

Ein Test ist am wertvollsten, wenn die Vortestwahrscheinlichkeit zwischen den Schwellen liegt und ein positives oder negatives Ergebnis den Patienten über eine der Schwellen verschieben kann.

flowchart TD
A["Klinische Vortest-<br>wahrscheinlichkeit einschätzen"] --> B["Liegt die Wahrscheinlichkeit in<br>einem Bereich, in dem der Test<br>das Vorgehen ändern kann?"]
B -->|"Nein, sehr niedrig"| C["Auf Test verzichten<br>und andere Ursache erwägen"]
B -->|"Nein, sehr hoch"| D["Behandlung oder definitive<br>Diagnostik erwägen"]
B -->|"Ja"| E["Test nach klinischer Rolle,<br>LR, Risiko und Verfügbarkeit wählen"]
E --> F["Ergebnis mit dem<br>Satz von Bayes interpretieren"]
F --> G["Nachtestwahrscheinlichkeit unter<br>der Ausschlussschwelle"]
F --> H["Nachtestwahrscheinlichkeit zwischen<br>den Schwellen"]
F --> I["Nachtestwahrscheinlichkeit über<br>der Handlungsschwelle"]
G --> J["Diagnostik beenden oder<br>neu ausrichten"]
H --> K["Durch unabhängigen Test<br>oder Verlaufskontrolle ergänzen"]
I --> L["Bei Bedarf bestätigen und<br>gezielte Maßnahme einleiten"]

Diagnostische Genauigkeit ist nicht gleich klinischer Nutzen

Ein genauer Test verbessert nicht automatisch die Patientenergebnisse. Der Nutzen hängt ab von:

  • ob das Ergebnis klinische Entscheidungen ändert
  • ob die nachfolgende Behandlung wirksam ist
  • wie schnell das Ergebnis vorliegt
  • Kosten und Ressourcenbedarf
  • Komplikationen der Probenentnahme oder weiterführenden Diagnostik
  • Folgen falsch positiver und falsch negativer Ergebnisse
  • den Wertvorstellungen des Patienten.

STARD 2015 betont, dass diagnostische Studien den vorgesehenen Einsatz des Tests, seine klinische Rolle und mögliche Konsequenzen für Patienten angeben sollen [7,8]. Ein konkretes Beispiel sind Schnelltests bei Halsschmerzen. Randomisierte Studien zeigten, dass ein testgesteuertes Vorgehen den Anteil der Antibiotikaverordnungen um etwa 25 Prozentpunkte senkte, die Evidenz zu Komplikationen und anderen patientenrelevanten Endpunkten jedoch unsicher war [20]. Genauigkeitsdaten müssen also durch Studien ergänzt werden, die untersuchen, wie der Test Versorgungsprozess und Gesundheit beeinflusst.

Die Decision-Curve-Analyse kann den Nettonutzen einer Teststrategie bei verschiedenen klinischen Wahrscheinlichkeitsschwellen abschätzen. Die Methode wägt richtig positive gegen falsch positive Ergebnisse anhand der Konsequenzen bei der gewählten Schwelle ab. Sie kann zeigen, dass ein Modell mit höherer AUC dennoch einen geringeren klinischen Nutzen hat, aufgrund mangelhafter Kalibrierung oder ungeeigneter Entscheidungen [19].

Interpretation in verschiedenen klinischen Situationen

Screening und niedrige Vortestwahrscheinlichkeit

Beim Screening sind die meisten Getesteten gesund. Selbst eine geringe Falsch-positiv-Rate kann daher mehr falsch positive als richtig positive Ergebnisse erzeugen. Die Anforderungen an Spezifität, Bestätigungstests und klare Algorithmen für die Nachverfolgung sind hoch.

Ein Screeningprogramm darf nicht allein anhand der Sensitivität beurteilt werden. Zu berücksichtigen sind außerdem:

  • absolute Zahl falsch positiver Ergebnisse
  • Überdiagnostik
  • invasive Folgeuntersuchungen
  • Angst und Etikettierung als krank
  • Ressourcenverbrauch
  • ob eine frühere Diagnose patientenrelevante Endpunkte verbessert.

Akute gefährliche Erkrankung

Bei Verdacht auf eine akute und gefährliche Erkrankung sind die Kosten eines falsch negativen Ergebnisses oft hoch. Die Teststrategie sollte daher eine niedrige LR− priorisieren. Ist die Vortestwahrscheinlichkeit hoch, kann ein negativer Test mit mäßiger LR− unzureichend sein, um die Erkrankung auszuschließen.

Ein negativer Test darf nicht isoliert interpretiert werden, wenn:

  • die Probe zu früh oder zu spät im Krankheitsverlauf entnommen wurde
  • die Probenqualität mangelhaft war
  • eine Behandlung den Test beeinflusst haben kann
  • der Patient zu einer Gruppe mit niedrigerer Sensitivität gehört
  • der Test für die vorliegende klinische Präsentation nicht validiert ist.

Bestätigende Diagnostik

Führt ein positiver Test zu einer bedeutsamen Behandlung, einer Operation oder einer langfristigen Diagnose, ist oft eine hohe LR+ erforderlich. Mitunter wird ein zweiter, methodisch unabhängiger Test benötigt, um das Risiko zu verringern, dass derselbe Störfaktor beide Ergebnisse verursacht.

Bildgebende Diagnostik

Studien zur Bildgebung sind besonders anfällig für:

  • die Erfahrung des Untersuchers
  • technische Ausstattung und Protokolle
  • Kenntnis klinischer Angaben
  • Kenntnis anderer Bildgebungsbefunde
  • unklare oder mehrere Grenzwerte
  • Verifikation überwiegend bei testpositiven Patienten.

Die klinische Rolle des Tests muss angegeben werden. Eine Methode kann spezifisch genug sein, um eine Veränderung vor einer Operation zu lokalisieren, aber nicht sensitiv genug, um die Erkrankung auszuschließen. In einem Cochrane-Review zur Bildgebung bei Endometriose variierte die Genauigkeit mit der anatomischen Lokalisation und der klinischen Rolle. Keine Untersuchungsmethode konnte die chirurgische Diagnostik für alle Formen der Beckenendometriose zuverlässig ersetzen, trotz guter Leistung bei bestimmten umschriebenen Läsionen [21].

Kritische Bewertung diagnostischer Studien

Patientenauswahl

Das am besten übertragbare Design umfasst in der Regel konsekutive oder zufällig ausgewählte Patienten, bei denen der Test in der klinischen Praxis in Betracht käme. Eine Fall-Kontroll-Studie, in der Patienten mit fortgeschrittener, gesicherter Erkrankung mit gesunden Kontrollen verglichen werden, erzeugt ein unnatürlich breites Spektrum. Solche Studien laufen Gefahr, sowohl Sensitivität als auch Spezifität zu überschätzen.

Zu prüfen sind:

  • Ein- und Ausschlusskriterien
  • Versorgungsstufe und Zuweisungswege
  • vorangegangene Testung
  • Stadium und Schweregrad der Erkrankung
  • relevante Differenzialdiagnosen in der Gruppe ohne Zielerkrankung
  • ob die Rekrutierung konsekutiv, zufällig oder als Gelegenheitsstichprobe erfolgte.

Empirische methodische Übersichtsarbeiten haben Variation in Demografie, Krankheitsprävalenz, Schweregrad, Verifikation, Beobachter und Instrument als wichtige Ursachen schwankender Genauigkeitsergebnisse identifiziert [9,11].

Referenzstandard

Der Referenzstandard muss nicht perfekt sein, aber er muss die Zielerkrankung ausreichend korrekt und unabhängig vom Indextest klassifizieren. Ein unzulänglicher Referenzstandard kann einen guten Indextest schlechter erscheinen lassen, oder umgekehrt.

Risiken umfassen:

  • Inkorporationsbias: Der Indextest ist Bestandteil der Referenzdiagnose.
  • Review-Bias: Wer den Referenzstandard interpretiert, kennt das Ergebnis des Indextests.
  • Differenzielle Verifikation: Je nach Ergebnis des Indextests werden unterschiedliche Referenzstandards verwendet.
  • Partielle Verifikation: Nur ein Teil der Patienten, häufig die testpositiven, erhält den Referenzstandard.
  • Veränderung im Zeitverlauf: Die Zielerkrankung verändert sich zwischen Indextest und Referenzstandard.

Gibt es keinen akzeptierten Referenzstandard, können zusammengesetzte Kriterien, Expertenpanels, longitudinale Nachbeobachtung oder statistische Latent-Class-Modelle eingesetzt werden. Jede Methode erfordert explizite Annahmen und kann zu unterschiedlichen Ergebnissen führen [12]. Latent-Class-Modelle behandeln den tatsächlichen Krankheitsstatus als nicht beobachtete Variable, die Ergebnisse können jedoch stark von Annahmen über die gegenseitige Abhängigkeit der Tests und über die Konstanz der Genauigkeit zwischen Populationen abhängen [13].

Verblindung und verfügbare klinische Information

Indextest und Referenzstandard sollten möglichst ohne Kenntnis des jeweils anderen Ergebnisses interpretiert werden. Gleichzeitig muss die Studie den vorgesehenen klinischen Einsatz nachbilden. Hat ein Radiologe normalerweise Zugang zu Symptomen, Voraufnahmen und Laborwerten, kann eine vollständige Verblindung zu einer weniger realistischen Schätzung führen.

Die Studie sollte daher klar angeben:

  • welche Informationen der Testauswerter hatte
  • welche Informationen der Referenzbeurteiler hatte
  • ob die Grenzwerte vorab festgelegt waren
  • Ausbildung und Erfahrung des Auswerters
  • wie mit Uneinigkeit zwischen Beurteilern umgegangen wurde.

Patientenfluss, Zeitintervall und Ausfälle

Alle eingeschlossenen Patienten sollten berichtet werden. Besondere Aufmerksamkeit ist geboten, wenn:

  • der Referenzstandard bei vielen Teilnehmern fehlt
  • sich die Ausfälle zwischen testpositiven und testnegativen Patienten unterscheiden
  • die Behandlung vor der Verifikation begonnen wurde
  • ein langes Intervall eine Veränderung der Erkrankung zulässt
  • nicht eindeutige Ergebnisse von der Analyse ausgeschlossen werden.

Der Ausschluss technisch fehlgeschlagener oder schwer interpretierbarer Ergebnisse kann ein übertrieben positives Bild der praktischen Leistung des Tests ergeben. Der Anteil solcher Ergebnisse und ihr klinischer Umgang sollten gesondert berichtet werden.

QUADAS-2 und STARD

QUADAS-2 bewertet diagnostische Studien in vier Domänen:

  1. Patientenauswahl
  2. Indextest
  3. Referenzstandard
  4. Patientenfluss und zeitlicher Ablauf.

Die ersten drei werden zusätzlich hinsichtlich der Anwendbarkeit beurteilt [10]. STARD 2015 ist eine Berichtsleitlinie mit 30 zentralen Punkten für die transparente Darstellung von Studien zur diagnostischen Genauigkeit [8]. STARD ist kein Qualitätssiegel, fehlende Angaben erschweren jedoch die Beurteilung von Bias.

Bei direkten Vergleichen zweier Tests ist es am besten, wenn beide Tests an denselben Patienten durchgeführt oder die Patienten auf Teststrategien randomisiert werden. Unterschiede zwischen separaten Studien können sonst eher auf Population und Durchführung als auf die Tests zurückgehen. QUADAS-C ergänzt QUADAS-2 für solche Vergleiche [18].

Statistische Unsicherheit und Metaanalyse

Konfidenzintervalle

Alle diagnostischen Maße sind Stichprobenschätzungen und sollten mit Konfidenzintervallen berichtet werden. Die Präzision der Sensitivität wird vor allem durch die Zahl der Personen mit Zielerkrankung bestimmt, die Präzision der Spezifität durch die Zahl der Personen ohne die Erkrankung.

Ein Ergebnis von 100 Prozent Sensitivität in einer Studie mit zehn erkrankten Patienten ist sehr unsicher. Null beobachtete falsch negative Ergebnisse beweisen nicht, dass die wahre Sensitivität 100 Prozent beträgt.

Diagnostische Studien sind oft zu klein. In einer Erhebung von 43 Studien lag der Median bei 49 Teilnehmern mit Zielerkrankung, und nur 5 Prozent berichteten eine vorab durchgeführte Fallzahlberechnung [14]. In einer späteren Auswertung von 89 Studien zu Depressionsinstrumenten berichteten nur 3 Prozent eine brauchbare Fallzahlberechnung, und nur 8 Prozent hatten ein Konfidenzintervall für die Sensitivität mit einer Breite von höchstens 10 Prozentpunkten [15].

Die Fallzahl sollte geplant werden auf Grundlage von:

  • minimal akzeptabler Sensitivität und Spezifität
  • gewünschter Breite der Konfidenzintervalle
  • erwarteter Prävalenz
  • Anteil nicht eindeutiger Ergebnisse und Ausfälle
  • geplanten Subgruppenanalysen
  • ob mehrere Tests verglichen werden sollen [16].

Metaanalyse der diagnostischen Genauigkeit

Sensitivität und Spezifität sind korreliert, insbesondere wenn Studien unterschiedliche Grenzwerte verwenden. Sie sollten daher nicht als völlig unabhängige Endpunkte metaanalysiert werden. Empfohlene Modelle sind das bivariate Modell und das hierarchische zusammenfassende ROC-Modell. Diese berücksichtigen sowohl die Variation innerhalb und zwischen Studien als auch den Zusammenhang zwischen Sensitivität und Spezifität [17].

Ein gepoolter Wert darf nicht interpretiert werden, ohne Folgendes zu prüfen:

  • Unterschiede in der Patientenpopulation
  • Grenzwerte
  • Probenentnahme und Analysetechnik
  • Referenzstandard
  • Versorgungssetting
  • Verzerrungsrisiko der Studien
  • Prädiktionsintervalle und Heterogenität.

Prädiktive Werte sollten in der Regel nicht direkt aus einer Metaanalyse auf eine lokale Population übertragen werden. Sie können stattdessen aus gepoolter Sensitivität, Spezifität und einer relevanten lokalen Vortestwahrscheinlichkeit berechnet werden.

Praktische Checkliste

Bei der Bewertung eines diagnostischen Testergebnisses ist Folgendes zu prüfen:

  1. Welche Zielerkrankung ist gemeint? Die Definition muss klinisch relevant sein.
  2. Welche Rolle hat der Test? Screening, Triage, Zusatztest, Ersatz oder Bestätigung.
  3. Wie hoch ist die Vortestwahrscheinlichkeit? Von Patient, Versorgungsstufe und vorliegenden Informationen ausgehen.
  4. Welcher Grenzwert wird verwendet? Prüfen, ob er der Validierung in der Studie und im Labor entspricht.
  5. Wie hoch sind Sensitivität und Spezifität? Als Paar lesen.
  6. Wie hoch sind LR+ und LR−? Den relevanten Likelihood-Quotienten zur Aktualisierung der Wahrscheinlichkeit verwenden.
  7. Wie präzise ist das Ergebnis? Konfidenzintervalle und Zahl der Personen mit bzw. ohne Zielerkrankung prüfen.
  8. Ähnelt die Studienpopulation dem Patienten? Alter, Stadium, Komorbidität, Symptome und vorangegangene Testung berücksichtigen.
  9. Ist der Referenzstandard glaubwürdig? Auf partielle, differenzielle oder inkorporierte Verifikation achten.
  10. Wie wurde mit nicht eindeutigen Ergebnissen und Ausfällen umgegangen? Ein Ausschluss kann die Leistung des Tests überschätzen.
  11. Ändert die Nachtestwahrscheinlichkeit das Vorgehen? Falls nicht, war der Test wahrscheinlich nicht gerechtfertigt.
  12. Ist die Teststrategie klinisch nützlich? Genauigkeit, Kosten, Risiko und Patientenergebnisse müssen gemeinsam abgewogen werden.

Quellen

  1. Habibzadeh F. Diagnostic tests performance indices: an overview. Biochemia Medica 2025. PMID: 39974192
  2. Eusebi P. Diagnostic accuracy measures. Cerebrovascular Diseases 2013. PMID: 24135733
  3. Bours MJ. Bayes' rule in diagnosis. Journal of Clinical Epidemiology 2021. PMID: 33741123
  4. Fischer JE, Bachmann LM, Jaeschke R. A readers' guide to the interpretation of diagnostic test properties: clinical example of sepsis. Intensive Care Medicine 2003. PMID: 12734652
  5. Hajian-Tilaki K. Receiver Operating Characteristic (ROC) Curve Analysis for Medical Diagnostic Test Evaluation. Caspian Journal of Internal Medicine 2013. PMID: 24009950
  6. Obuchowski NA, Lieber ML, Wians FH Jr. ROC curves in clinical chemistry: uses, misuses, and possible solutions. Clinical Chemistry 2004. PMID: 15142978
  7. Cohen JF, Korevaar DA, Altman DG et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
  8. Bossuyt PM, Reitsma JB, Bruns DE et al. STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ 2015. PMID: 26511519
  9. Whiting P, Rutjes AW, Reitsma JB et al. Sources of variation and bias in studies of diagnostic accuracy: a systematic review. Annals of Internal Medicine 2004. PMID: 14757617
  10. Whiting PF, Rutjes AW, Westwood ME et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
  11. Whiting P, Rutjes AW, Dinnes J et al. Development and validation of methods for assessing the quality of diagnostic accuracy studies. Health Technology Assessment 2004. PMID: 15193208
  12. Rutjes AW, Reitsma JB, Coomarasamy A et al. Evaluation of diagnostic tests when there is no gold standard. A review of methods. Health Technology Assessment 2007. PMID: 18021577
  13. Collins J, Huynh M. Estimation of diagnostic test accuracy without full verification: a review of latent class methods. Statistics in Medicine 2014. PMID: 24910172
  14. Bachmann LM, Puhan MA, ter Riet G et al. Sample sizes of studies on diagnostic accuracy: literature survey. BMJ 2006. PMID: 16627488
  15. Thombs BD, Rice DB. Sample sizes and precision of estimates of sensitivity and specificity from primary studies on the diagnostic accuracy of depression screening tools: a survey of recently published studies. International Journal of Methods in Psychiatric Research 2016. PMID: 27060912
  16. Hajian-Tilaki K. Sample size estimation in diagnostic test studies of biomedical informatics. Journal of Biomedical Informatics 2014. PMID: 24582925
  17. Ma X, Nie L, Cole SR et al. Statistical methods for multivariate meta-analysis of diagnostic tests: an overview and tutorial. Statistical Methods in Medical Research 2016. PMID: 23804970
  18. Yang B, Mallett S, Takwoingi Y et al. QUADAS-C: A Tool for Assessing Risk of Bias in Comparative Diagnostic Accuracy Studies. Annals of Internal Medicine 2021. PMID: 34698503
  19. Van Calster B, Wynants L, Verbeek JFM et al. Reporting and Interpreting Decision Curve Analysis: A Guide for Investigators. European Urology 2018. PMID: 30241973
  20. Cohen JF, Pauchard JY, Hjelm N et al. Efficacy and safety of rapid tests to guide antibiotic prescriptions for sore throat. Cochrane Database of Systematic Reviews 2020. PMID: 32497279
  21. Nisenblat V, Bossuyt PM, Farquhar C et al. Imaging modalities for the non-invasive diagnosis of endometriosis. Cochrane Database of Systematic Reviews 2016. PMID: 26919512

Aktualisiert 29. September 2026