Klinischer Hintergrund
Die 2×2-Vierfeldertafel ist der gemeinsame Nenner für praktisch alle diagnostischen und epidemiologischen Maßzahlen, denen eine Klinikerin oder ein Kliniker in der Praxis begegnet. Ob es darum geht, die Fähigkeit eines Labortests zum Ausschluss einer Erkrankung zu beurteilen, das Ergebnis einer Screeningkampagne zu interpretieren oder die absoluten und relativen Effektmaße einer Behandlungsstudie zu verstehen – alles wird aus denselben vier Feldern abgeleitet. Das Problem ist nicht ein Mangel an Maßzahlen, sondern deren Überfülle: Sensitivität, Spezifität, prädiktive Werte, Likelihood-Quotienten, Odds Ratio, relatives Risiko, NNT. Jede Maßzahl beantwortet eine andere Frage und hat ihre eigenen Fallstricke, und es ist leicht, die falsche Maßzahl für die klinische Fragestellung zu wählen. Der Rechner fasst alle Berechnungen an einem Ort zusammen, sodass man schnell von rohen Anzahlen zu interpretierbaren Größen gelangen kann, ohne Begriffe durcheinanderzubringen.
Berechnung der 2×2-Vierfeldertafel
Die Tabelle hat vier Felder, definiert durch den Test- oder Expositionsstatus (Zeilen) gegenüber dem Krankheits- oder Ergebnisstatus (Spalten):
| Krankheit/Ergebnis + | Krankheit/Ergebnis − | |
|---|---|---|
| Test/Exposition + | a (richtig positiv) | b (falsch positiv) |
| Test/Exposition − | c (falsch negativ) | d (richtig negativ) |
Aus diesen vier Anzahlen wird berechnet:
Sensitivität und Spezifität wurden in ihrer modernen Form von Altman und Bland in einer Reihe methodologischer Aufsätze im BMJ 1994 definiert [1]. Ihre Darstellung beruht auf der klassischen Vierfeldertafel, in der die Sensitivität der Anteil der Kranken ist, die positiv getestet werden, und die Spezifität der Anteil der Gesunden, die negativ getestet werden. Dieselbe Serie definierte die prädiktiven Werte als Funktion des Testergebnisses und nicht des Krankheitsstatus, das heißt die Wahrscheinlichkeit einer Erkrankung bei positivem Test (PPV) beziehungsweise das Fehlen einer Erkrankung bei negativem Test (NPV) [2]. Die Likelihood-Quotienten (LR+ und LR−) beruhen auf denselben Feldern, drücken jedoch aus, um wie viele Male wahrscheinlicher ein bestimmtes Testergebnis bei einer kranken gegenüber einer gesunden Person ist, und werden mithilfe des Satzes von Bayes integriert, um die Posttestwahrscheinlichkeit zu liefern [3].
Interpretation in der Praxis
Die Maßzahlen beantworten unterschiedliche klinische Fragen und sind entsprechend der jeweils aktuellen Fragestellung zu interpretieren.
Sensitivität und Spezifität sind Eigenschaften des Tests, nicht der Patientin oder des Patienten. Eine hohe Sensitivität (nahe 1,0) bedeutet, dass ein negatives Ergebnis eine Erkrankung zuverlässig ausschließt, was für das Screening und die Ausschlussdiagnostik entscheidend ist. Eine hohe Spezifität bedeutet, dass ein positives Ergebnis eine Erkrankung zuverlässig bestätigt. Beide Maßzahlen sind unabhängig von der Krankheitsprävalenz in der Population, in der der Test eingesetzt wird – das ist ihre Stärke, aber auch ihre Grenze: Sie sagen nichts darüber aus, wie wahrscheinlich es ist, dass gerade diese Patientin mit einem positiven Test tatsächlich krank ist.
Prädiktive Werte füllen diese Lücke. Der PPV beantwortet die Frage „die Patientin hat einen positiven Test, wie groß ist die Wahrscheinlichkeit, dass sie krank ist?“, und der NPV beantwortet die spiegelbildliche Frage. Ihre entscheidende Eigenschaft ist ihre Prävalenzabhängigkeit: Bei niedriger Prävalenz kann selbst ein Test mit hoher Spezifität einen niedrigen PPV ergeben, weil die falsch Positiven die richtig Positiven überwiegen. Das ist die häufigste Ursache dafür, dass ein Test, der in einer Spezialklinik gut abschneidet, in der Primärversorgung versagt.
Likelihood-Quotienten kombinieren Informationen aus Sensitivität und Spezifität zu einer einzigen Maßzahl, die prävalenzunabhängig ist und mit der sich die Pretestwahrscheinlichkeit über den Satz von Bayes zur Posttestwahrscheinlichkeit aktualisieren lässt [3]. Faustregeln für die klinische Interpretation:
| LR+ | Effekt auf die Wahrscheinlichkeit |
|---|---|
| >10 | Große, oft ausschlaggebende Zunahme |
| 5–10 | Mäßige Zunahme |
| 2–5 | Geringe Zunahme |
| 0,5–2 | Klinisch nicht informativ |
| 0,1–0,5 | Mäßige Abnahme |
| <0,1 | Große, oft ausschlaggebende Abnahme |
Ein LR+ über 10 bedeutet in der Praxis, dass ein positives Testergebnis oft ausreicht, um eine Diagnose zu stellen, und ein LR− unter 0,1 bedeutet, dass ein negatives Ergebnis oft ausreicht, um sie zu verwerfen [3]. Quotienten nahe 1 verändern die Wahrscheinlichkeit kaum und sollten keine klinischen Entscheidungen steuern.
Odds Ratio und relatives Risiko gelten, wenn die Tabelle als Exposition gegenüber Ergebnis statt als Test gegenüber Erkrankung interpretiert wird. Das relative Risiko ist die intuitivere Maßzahl: um wie viele Male häufiger das Ergebnis bei Exponierten im Vergleich zu Nichtexponierten auftritt. Die Odds Ratio wird häufig in Fall-Kontroll-Studien und in der logistischen Regression verwendet, approximiert das relative Risiko jedoch nur dann, wenn das Ergebnis selten ist, grob gesagt unter 10 Prozent der Studienteilnehmer. Bei höherer Ereignisfrequenz divergieren die beiden Maßzahlen, und die Odds Ratio überschätzt dann den Effekt.
NNT (number needed to treat) ist der Kehrwert der absoluten Risikodifferenz und gibt an, wie viele Patientinnen und Patienten behandelt werden müssen, um ein Ereignis zu verhindern. Eine niedrige NNT bedeutet eine wirksame Behandlung. Steht Zeile 1 stattdessen für eine schädliche Exposition, wird dieselbe Maßzahl zur NNH (number needed to harm).
Validierung und Leistungsfähigkeit
Im Gegensatz zu klinischen Risikoscores oder Prädiktionsmodellen ist die 2×2-Vierfeldertafel kein Instrument, das empirisch validiert wird. Sie ist eine mathematische Zerlegung von vier Anzahlen in standardisierte Maßzahlen, und die Berechnungen sind exakt. Was sich stattdessen prüfen lässt, sind die Annahmen, die jeder Maßzahl zugrunde liegen, und wie robust sie unter verschiedenen Bedingungen sind.
Sensitivität und Spezifität sind theoretisch unabhängig von der Prävalenz, in der Praxis jedoch bei kleinen Stichproben oft instabil, insbesondere wenn ein Feld nur wenige Beobachtungen enthält. Die Konfidenzintervalle können breit sein, selbst wenn die Punktschätzung beeindruckend aussieht. Der Rechner liefert Punktschätzungen ohne Konfidenzintervall, was eine bewusste Einschränkung ist: Bei klinisch wichtigen Entscheidungen sollte das Intervall gesondert berechnet werden, besonders wenn die Gesamtzahl in der Tabelle klein ist.
Die Likelihood-Quotienten nehmen eine Sonderstellung ein, da sie Informationen sowohl aus der Sensitivität als auch aus der Spezifität in einem prävalenzunabhängigen Format bewahren und sich direkt über die Odds-Form des Satzes von Bayes mit der Pretestwahrscheinlichkeit kombinieren lassen [3]. In einem konkreten Beispiel von Habibzadeh et al. erhöhte ein LR+ von 12,0 die Wahrscheinlichkeit eines Diabetes von 10 auf 57 Prozent bei einem Nüchternplasmaglukose-Schwellenwert von 98 mg/dL, während ein LR− von 0,42 sie auf 5 Prozent senkte [3]. Dies veranschaulicht, wie Likelihood-Quotienten Testeigenschaften in klinisch handlungsleitende Wahrscheinlichkeiten übersetzen.
Einschränkungen
Prädiktive Werte sind prävalenzabhängig. PPV und NPV, die aus einer Tabelle berechnet werden, spiegeln die Prävalenz wider, die in der Studienpopulation herrschte, aus der die Anzahlen stammen. Die Übertragung eines PPV aus einer Studie in einer hochprävalenten Spezialklinik auf eine niedrigprävalente Primärversorgungspopulation führt systematisch zu einer Überschätzung der Wahrscheinlichkeit bei positivem Test. Um in einer neuen Population korrekte prädiktive Werte zu erhalten, sollten diese mithilfe von Likelihood-Quotienten und der aktuellen Pretestwahrscheinlichkeit neu berechnet und nicht direkt wiederverwendet werden.
Nullfelder. Ist eines der Felder b oder c gleich null, wird die Odds Ratio unendlich beziehungsweise null, und der entsprechende Likelihood-Quotient kann extrem werden. Dies ist besonders problematisch bei kleinen Stichproben, in denen ein Nullfeld rein zufällig entstehen kann. In solchen Fällen sollte eine Kontinuitätskorrektur erwogen werden oder, besser noch, sollten mehr Daten gesammelt werden, bevor die Maßzahlen interpretiert werden.
Die Odds Ratio ist bei häufigen Ergebnissen nicht gleich dem relativen Risiko. Die Annahme, dass die Odds Ratio das relative Risiko approximiert, gilt nur, wenn die Ergebnisfrequenz niedrig ist, ungefähr unter 10 Prozent. Bei höherer Frequenz überschätzt die Odds Ratio den Effekt, mitunter erheblich. Eine Odds Ratio von 4,0 bei einer Ergebnisfrequenz von 30 Prozent entspricht einem relativen Risiko von deutlich weniger als 4,0. Wird die Tabelle als Exposition gegenüber Ergebnis interpretiert und ist das Ergebnis häufig, sollte das relative Risiko anstelle der Odds Ratio verwendet werden, wann immer beide berechnet werden können.
Die NNT ist bei einer Risikodifferenz von null nicht definiert. Ist die absolute Risikodifferenz null, wird die NNT unendlich, was bedeutet, dass die Behandlung keine Wirkung hat. Ist die Risikodifferenz negativ (die Exposition oder Behandlung erhöht das Risiko), wird die NNT formal negativ und sollte als NNH interpretiert werden.
Die Treffsicherheit (accuracy) ist eine grobe Maßzahl. Sie fasst richtig Positive und richtig Negative zu einem Anteil zusammen, verschleiert jedoch Ungleichgewichte zwischen Sensitivität und Spezifität. Ein Test kann eine hohe Treffsicherheit aufweisen und dennoch klinisch wertlos sein, wenn er kranke Patientinnen und Patienten übersieht, insbesondere bei niedriger Prävalenz, wo ein Test, der stets „gesund“ sagt, eine hohe Treffsicherheit erreicht.
Quellen
- Altman DG, Bland JM. Diagnostic tests 1: sensitivity and specificity. BMJ. 1994;308(6943):1552. PMID: 8019315
- Altman DG, Bland JM. Diagnostic tests 2: predictive values. BMJ. 1994;309(6947):102. PMID: 8038641
- Habibzadeh F, Habibzadeh P. The likelihood ratio and its graphical representation. Biochem Med (Zagreb). 2019;29(2):020101. PMID: 31015780