Zusammenfassung
Die Interpretation von Studienergebnissen sollte einer festen Reihenfolge folgen. Am Anfang stehen die Fragestellung, das Studiendesign und der primäre Endpunkt. Anschließend werden das Risiko systematischer Fehler beurteilt, die Effektgröße zusammen mit ihrem Konfidenzintervall gelesen und relative Effekte bei einem relevanten Ausgangsrisiko in absolute Konsequenzen übersetzt. Erst danach sollte der p-Wert berücksichtigt werden. Statistische Signifikanz zeigt weder, dass der Effekt klinisch bedeutsam ist, noch dass das Ergebnis frei von Bias ist. Ein nicht signifikantes Ergebnis zeigt nicht, dass die Behandlungen gleichwertig sind.
Randomisierte Studien liefern in der Regel die beste Grundlage für Behandlungseffekte, doch die Randomisierung schützt nicht vor unzureichender Verdeckung der Zuteilung (Allocation Concealment), Studienabbrüchen, selektivem Berichten oder ungeeigneten Analysen. Beobachtungsstudien können für Prognose, seltene Nebenwirkungen und Langzeiteffekte unverzichtbar sein, Assoziationen müssen jedoch unter besonderer Berücksichtigung von Confounding, Selektion und zeitbezogenem Bias bewertet werden. Systematische Übersichtsarbeiten sind nicht automatisch verlässlich. Ihr Wert hängt von Literatursuche, Studieneinschluss, Risiko für Bias, Heterogenität und Publikationsbias ab.
Schließlich ist die Übertragbarkeit des Ergebnisses gegen Risiko, Komorbidität, Behandlungsalternativen, Wertvorstellungen und Nachbeobachtungszeit des jeweiligen Patienten abzuwägen. Eine sinnvolle klinische Schlussfolgerung benennt daher Richtung, Größe und Unsicherheit des Effekts, die Vertrauenswürdigkeit der Evidenz sowie den zu erwartenden absoluten Nutzen und Schaden.
Eine praktische Reihenfolge der Interpretation
Berichtsleitlinien wie CONSORT, STROBE und PRISMA verbessern die Transparenz von Berichten über randomisierte Studien, Beobachtungsstudien bzw. systematische Übersichtsarbeiten [1-3]. Sie sind jedoch keine Gütesiegel. Eine gut geschriebene Studie kann methodisch schwach sein, während eine mangelhaft berichtete Studie mitunter gut durchgeführt, aber nicht beurteilbar ist.
Das folgende Vorgehen verringert das Risiko, dass die Schlussfolgerung vom Titel, vom Abstract oder vom p-Wert des Artikels bestimmt wird:
flowchart TD
A["Klinische Frage formulieren<br>und Studiendesign identifizieren"] --> B["Population, Intervention,<br>Vergleich und Endpunkte prüfen"]
B --> C["Primären Endpunkt<br>und präregistrierte Analyse identifizieren"]
C --> D["Risiko systematischer Fehler<br>und Studienabbrüche beurteilen"]
D --> E["Effektgröße und<br>Konfidenzintervall lesen"]
E --> F["Absoluten Effekt bei<br>relevantem Ausgangsrisiko berechnen"]
F --> G["Klinische Bedeutung, Schäden<br>und Nachbeobachtungszeit beurteilen"]
G --> H["Konsistenz, Indirektheit<br>und Publikationsbias bewerten"]
H --> I["Entscheiden, ob das Ergebnis<br>auf den Patienten übertragbar ist"]GRADE unterscheidet zwischen der methodischen Qualität einzelner Studien und der Vertrauenswürdigkeit eines zusammengefassten Evidenzkörpers. Die Vertrauenswürdigkeit der Evidenz wird anhand von Risiko für Bias, Inkonsistenz, Indirektheit, mangelnder Präzision und Publikationsbias als hoch, moderat, niedrig oder sehr niedrig eingestuft. Die Graduierung der Evidenz ist von der Stärke der Empfehlung zu trennen, da auch Nutzen, Schaden, Ressourcenverbrauch und Patientenpräferenzen eine klinische Entscheidung beeinflussen [4].
Mit der richtigen Frage und dem richtigen Studiendesign beginnen
Die Frage strukturieren
Eine Therapiefrage lässt sich in der Regel beschreiben durch:
- Population: Welche Patienten wurden untersucht?
- Intervention: Welche Behandlung, Dosis, Intensität und Behandlungsdauer wurden eingesetzt?
- Vergleich: Placebo, keine Behandlung, Standardtherapie oder aktive Kontrolle?
- Endpunkt: Welche patientenrelevanten Endpunkte wurden erhoben?
- Zeit: Wann wurde der Endpunkt erhoben?
Die Frage muss dem Estimand der Studie entsprechen, also dem Effekt, den die Analyse tatsächlich schätzen soll. Der Effekt der Zuteilung zu einer Behandlung, der Effekt des Beginns einer Behandlung und der Effekt der protokollgemäßen Durchführung der Behandlung sind unterschiedliche Fragen.
Das Studiendesign nach der Frage wählen
| Klinische Frage | In der Regel informativstes Design | Wichtige Limitationen |
|---|---|---|
| Wirksamkeit von Behandlung oder Prävention | Randomisierte kontrollierte Studie | Studienabbrüche, Crossover, unzureichende Verblindung, kurze Nachbeobachtung |
| Seltene oder späte Nebenwirkungen | Große Kohorte, Registerstudie, Fall-Kontroll-Studie | Confounding, Fehlklassifikation, Selektion |
| Diagnostische Genauigkeit | Querschnittsstudie oder prospektive Kohorte mit relevantem Referenzstandard | Spektrumbias, Verifikationsbias, ungeeigneter Schwellenwert |
| Prognose | Inzeptionskohorte mit ausreichender Nachbeobachtung | Selektiver Loss to Follow-up, Overfitting, konkurrierende Ereignisse |
| Prävalenz | Repräsentative Querschnittsstudie | Auswahl- und Non-Response-Bias |
| Gepoolter Behandlungseffekt | Systematische Übersichtsarbeit und Metaanalyse | Mängel bei Suche, Primärstudien, Synthese oder Berichterstattung |
Das Studiendesign bestimmt, welche Schlussfolgerungen möglich sind. Eine randomisierte Studie kann einen kausalen Behandlungseffekt stützen. Eine Beobachtungsstudie zeigt primär eine Assoziation, auch nach statistischer Adjustierung. Eine diagnostische Studie zeigt, wie ein Test Patienten klassifiziert, nicht notwendigerweise, ob die Einführung des Tests die Gesundheit verbessert.
Interne Validität vor der Größe der Ergebnisse beurteilen
Randomisierte Studien
Die Randomisierung erzeugt Gruppen, die im Erwartungswert vergleichbar sind, aber nur dann, wenn die Zuteilungssequenz zufällig ist und bis zum Einschluss verdeckt bleibt. Die verdeckte Zuteilung (Allocation Concealment) ist nicht mit Verblindung zu verwechseln:
- Die verdeckte Zuteilung verhindert, dass die einschließende Person die nächste Zuteilung vorhersehen kann.
- Die Verblindung verhindert, dass Teilnehmende, Behandelnde oder Endpunktbeurteilende durch Kenntnis der Zuteilung beeinflusst werden.
Metaepidemiologische Daten zeigen, dass eine unzureichende oder unklare Sequenzgenerierung und verdeckte Zuteilung im Mittel mit überschätzten Behandlungseffekten verbunden sind. Das Problem ist bei subjektiv beurteilten Endpunkten und bei fehlender Verblindung der Endpunktbeurteilenden am deutlichsten [5].
Prüfen Sie mindestens Folgendes:
- War die Randomisierungsmethode glaubwürdig?
- War die Zuteilung bis zum Einschluss verdeckt?
- War Verblindung möglich, wurde sie umgesetzt und war sie wahrscheinlich erfolgreich?
- War der primäre Endpunkt vor Einsicht in die Daten definiert?
- Wurden die Gruppen gemäß der ursprünglichen Zuteilung analysiert?
- Wie hoch war der Loss to Follow-up, warum trat er auf und unterschied er sich zwischen den Gruppen?
- War die Nachbeobachtung sowohl für Nutzen als auch für Schaden ausreichend lang?
- Stimmt die Publikation mit Protokoll, Register und statistischem Analyseplan überein?
Statistische Signifikanztests von Baseline-Variablen sollten nicht verwendet werden, um zu beurteilen, ob die Randomisierung gelungen ist. Zufällige Unterschiede sind zu erwarten. Wichtiger ist, ob die Unterschiede prognostisch bedeutsam sind, ob sie durch Selektion nach der Randomisierung entstanden sein können und ob die geplante Analyse starke prognostische Faktoren berücksichtigt hat.
Intention-to-treat und Per-Protokoll
Eine Intention-to-treat-Analyse vergleicht die Teilnehmenden gemäß der randomisierten Gruppe, unabhängig von Adhärenz und Crossover. Sie bewahrt die prognostische Balance der Randomisierung und schätzt in der Regel den Effekt einer Behandlungsstrategie oder Behandlungszuteilung.
Eine Per-Protokoll-Analyse schränkt Teilnehmende nach Adhärenz ein oder klassifiziert sie danach um. Sie kann sich dem Effekt der tatsächlichen Einhaltung der Behandlung besser annähern, doch der Schutz der Randomisierung kann verloren gehen, da Adhärenz häufig mit der Prognose zusammenhängt.
Der Begriff modifizierte Intention-to-treat hat keine einheitliche Bedeutung. Lesen Sie genau, welche Teilnehmenden ausgeschlossen wurden. Ein Ausschluss nach der Randomisierung, etwa von Patienten, die nie eine Dosis eingenommen haben oder bei denen ein bestimmter Laborwert fehlte, kann Selektionsbias erzeugen.
Loss to Follow-up und fehlende Daten
Der Anteil der Studienabbrüche allein bestimmt nicht das Risiko für Bias. Ein Loss to Follow-up von fünf Prozent kann gravierend sein, wenn er mit Behandlung und Endpunkt zusammenhängt, während ein größerer zufälliger Loss to Follow-up mitunter weniger bedeutsam ist. Beurteilen Sie:
- absolute Anzahl und Anteil in jeder Gruppe
- Gründe und Zeitpunkt
- ob der Endpunkt nach dem letzten Kontakt eingetreten sein könnte
- Annahmen bei der Imputation
- Sensitivitätsanalysen unter alternativen Annahmen
Eine Analyse positiver kardiovaskulärer Studien fand einen medianen Fragility Index von 13. In etwa 30 Prozent der Studien überstieg die Zahl der Lost-to-Follow-up-Fälle den Fragility Index [6]. Der Fragility Index gibt an, wie wenige Ereignisse geändert werden müssen, damit ein signifikantes binäres Ergebnis nicht signifikant wird. Das Maß kann die statistische Fragilität veranschaulichen, ersetzt aber weder Effektgröße noch Konfidenzintervall oder Risiko für Bias.
Finanzierung und Interessenkonflikte
Die Finanzierung ist für sich genommen kein Beweis dafür, dass eine Studie fehlerhaft ist, muss aber in die Gesamtbewertung einfließen. In einer methodischen Cochrane-Übersichtsarbeit fielen industriegesponserte Arzneimittel- und Medizinproduktstudien häufiger zugunsten des Produkts des Sponsors aus, sowohl hinsichtlich der Wirksamkeitsergebnisse als auch der Schlussfolgerungen. Der Unterschied ließ sich durch die üblichen Risk-of-Bias-Domänen nicht vollständig erklären [7].
Prüfen Sie daher die Rolle des Sponsors bei Design, Datenmanagement, Analyse, Manuskript und Publikationsentscheidung. Lesen Sie die finanziellen Beziehungen der Autoren und ob unabhängige Forschende Zugang zu den vollständigen Daten hatten.
Effektmaße verstehen
Ein Studienergebnis sollte mit drei Komponenten beschrieben werden:
- Der Punktschätzer, die mit den beobachteten Daten am besten vereinbare Schätzung.
- Die Unsicherheit, in der Regel ein 95-%-Konfidenzintervall.
- Die klinische Skala, zum Beispiel absolutes Risiko, Symptomscore oder Überlebenszeit.
Binäre Endpunkte
Angenommen, ein Ereignis tritt hypothetisch bei 20 Prozent der Kontrollgruppe und bei 15 Prozent der Behandlungsgruppe auf.
| Maß | Berechnung | Ergebnis | Interpretation |
|---|---|---|---|
| Risiko in der Kontrollgruppe | 20 von 100 | 20 Prozent | Ausgangsrisiko |
| Risiko in der Behandlungsgruppe | 15 von 100 | 15 Prozent | Risiko unter Behandlung |
| Risk Ratio, RR | 0,15 / 0,20 | 0,75 | Relatives Risiko ist 25 Prozent niedriger |
| Relative Risikoreduktion | 1 minus 0,75 | 25 Prozent | Relative Verringerung |
| Absolute Risikoreduktion | 0,20 minus 0,15 | 5 Prozentpunkte | 5 Ereignisse weniger pro 100 |
| Number needed to treat, NNT | 1 / 0,05 | 20 | 20 müssen über den angegebenen Zeitraum behandelt werden, um ein Ereignis zu verhindern |
Die NNT ist stets an Population, Behandlung, Endpunkt und Zeit zu koppeln. Eine NNT von 20 nach fünf Jahren ist nicht mit einer NNT von 20 nach 30 Tagen vergleichbar. Bei der Beschreibung von Nutzen wird die NNT in der Regel auf die nächste ganze Zahl aufgerundet. Für Schaden wird häufig die Number needed to harm, NNH, verwendet.
Der absolute Effekt hängt vom Ausgangsrisiko ab. Lässt sich ein RR von 0,75 auf eine Population mit 4 Prozent Risiko übertragen, beträgt das Risiko unter Behandlung etwa 3 Prozent, die absolute Risikoreduktion 1 Prozentpunkt und die NNT etwa 100. Derselbe relative Effekt kann daher bei Hochrisikopatienten klinisch bedeutsam, bei Niedrigrisikopatienten jedoch marginal sein.
Odds Ratio
Die Odds Ratio, OR, vergleicht Odds statt Risiken. Ist das Ereignis selten, liegt die OR nahe am RR. Bei häufigen Endpunkten kann die OR einen stärkeren Eindruck vom Effekt vermitteln und sollte nicht als Risk Ratio beschrieben werden.
In Fall-Kontroll-Studien lässt sich das absolute Risiko normalerweise nicht direkt aus der Stichprobe berechnen, da die Zahl der Fälle und Kontrollen durch das Studiendesign festgelegt ist. Die OR ist dort ein natürliches Assoziationsmaß.
Kontinuierliche Endpunkte
Eine Mittelwertdifferenz behält die ursprüngliche Einheit bei, beispielsweise 4 mm Hg niedrigerer systolischer Blutdruck oder 1,5 Punkte weniger Schmerz. Fragen Sie, ob der Unterschied größer als der Messfehler und klinisch bedeutsam ist.
Die standardisierte Mittelwertdifferenz wird verwendet, wenn Studien dasselbe Phänomen mit unterschiedlichen Skalen messen. Das Ergebnis wird in Standardabweichungen ausgedrückt und ist weniger intuitiv. Seine klinische Bedeutung hängt von der Validität der Skalen und der Variabilität in den untersuchten Populationen ab.
Ein minimaler klinisch relevanter Unterschied ist keine universelle Naturkonstante. Er kann vom Ausgangswert, vom Schweregrad der Erkrankung, von der Patientenperspektive, von der Methode und davon abhängen, ob sich die Veränderung auf ein Individuum oder eine Gruppe bezieht. Vergleichen Sie das Konfidenzintervall daher sowohl mit null als auch mit einer im Voraus begründeten klinischen Grenze.
Zeit-bis-Ereignis-Endpunkte
Eine Hazard Ratio, HR, vergleicht die momentane Ereignisrate zwischen den Gruppen. Eine HR von 0,75 bedeutet nicht automatisch, dass 25 Prozent der Ereignisse verhindert werden, dass sich das Überleben um 25 Prozent verlängert oder dass das Risiko zu einem bestimmten Zeitpunkt 25 Prozent niedriger ist.
Interpretieren Sie die HR zusammen mit:
- Kaplan-Meier-Kurven oder kumulativen Inzidenzkurven
- Anzahl der Patienten unter Risiko im Zeitverlauf
- absoluten Ereignisrisiken zu klinisch relevanten Zeitpunkten
- medianer Nachbeobachtungszeit
- Prüfung der Annahme proportionaler Hazards
Kreuzen sich die Kurven, kann eine einzelne HR irreführend sein. Alternativen wie die Restricted Mean Survival Time können dann informativer sein.
Bei konkurrierenden Risiken, etwa Tod aus anderer Ursache vor Eintreten eines Nierenversagens, kann die übliche Kaplan-Meier-Methode die Wahrscheinlichkeit des interessierenden Endpunkts überschätzen. In einer Auswertung randomisierter Studien mit Zeit-bis-Ereignis-Endpunkten waren 31 von 40 potenziell konkurrierenden Risiken ausgesetzt, doch nur fünf berichteten die kumulative Inzidenzfunktion [8]. Konkurrierende Ereignisse dürfen nicht unkritisch wie gewöhnliche Zensierung behandelt werden.
Konfidenzintervalle, p-Werte und klinische Bedeutung
Das Konfidenzintervall
Ein 95-%-Konfidenzintervall beschreibt, welche Effektgrößen mit den Daten und den Modellannahmen vereinbar sind. Bei wiederholten Studien mit derselben Methode würden 95 Prozent der berechneten Intervalle den wahren Parameterwert überdecken.
Der Nullwert ist:
- RR, OR oder HR = 1
- Risikodifferenz oder Mittelwertdifferenz = 0
Ein schmales Intervall zeigt eine höhere Präzision als ein breites Intervall, doch Präzision garantiert keine Richtigkeit. Eine sehr große Beobachtungsstudie kann ein extrem schmales Intervall um einen verzerrten Schätzwert liefern.
Vier häufige Muster sind:
| Ergebnis | Konfidenzintervall | Plausible Interpretation |
|---|---|---|
| Klinisch bedeutsamer Effekt | Schließt null und trivialen Effekt aus | Unterstützt einen relevanten Effekt, sofern das Risiko für Bias niedrig ist |
| Statistisch signifikanter, aber trivialer Effekt | Schließt null aus, liegt aber nahe der klinischen Grenze | Wahrscheinlich geringer klinischer Nutzen |
| Nicht signifikant und präzise | Schließt klinisch bedeutsamen Effekt aus | Spricht gegen einen relevanten Effekt |
| Nicht signifikant und unpräzise | Umfasst sowohl relevanten Nutzen als auch Schaden | Unzureichende Information, kein Beweis für fehlenden Effekt |
Der p-Wert
Der p-Wert ist die Wahrscheinlichkeit, unter der Nullhypothese und den Annahmen des Analysemodells ein Ergebnis zu beobachten, das mindestens so extrem ist wie das erhaltene. Er ist nicht:
- die Wahrscheinlichkeit, dass die Nullhypothese wahr ist
- die Wahrscheinlichkeit, dass das Ergebnis auf Zufall beruht
- die Größe des Effekts
- die Wahrscheinlichkeit, dass das Ergebnis repliziert wird
- ein Maß für die klinische Bedeutung
Die Grenze von 0,05 ist eine Konvention, keine biologische Trennlinie. Ergebnisse mit p = 0,049 und p = 0,051 sollten nicht als qualitativ gegensätzlich behandelt werden. Berichten und interpretieren Sie den exakten p-Wert zusammen mit Effektgröße und Konfidenzintervall.
Multiple Analysen
Werden 20 unabhängige Hypothesen auf einem Signifikanzniveau von 0,05 getestet, beträgt die Wahrscheinlichkeit für mindestens ein falsch positives Ergebnis etwa 64 Prozent, wenn alle Nullhypothesen wahr sind. Das Risiko steigt bei vielen:
- Endpunkten
- Zeitpunkten
- Dosierungen
- Subgruppen
- statistischen Modellen
- alternativen Definitionen
Prüfen Sie daher, ob die Analyse vordefiniert, hierarchisch getestet oder für Multiplizität korrigiert war. Ein signifikanter sekundärer Endpunkt wiegt wenig, wenn der primäre Endpunkt negativ war und keine Strategie für Multiplizität vorlag.
Irreführende Darstellung, häufig als Spin bezeichnet, bedeutet, dass die Autoren sekundäre Endpunkte, Subgruppen oder günstige Formulierungen hervorheben, obwohl der primäre Endpunkt die Schlussfolgerung nicht stützt. In einer systematischen Auswertung negativer Nichtunterlegenheitsstudien in der Onkologie wurde in 75 Prozent der Berichte Spin festgestellt [9]. Lesen Sie daher den Ergebnisteil vor der Schlussfolgerung der Diskussion.
Relevanz der Endpunkte
Primäre, sekundäre und explorative Endpunkte
Der primäre Endpunkt bestimmt in der Regel die Fallzahlberechnung und die hauptsächliche Hypothesenprüfung. Sekundäre Endpunkte können wichtige ergänzende Informationen liefern, haben aber häufig eine geringere statistische Aussagekraft. Post-hoc-Analysen sind hypothesengenerierend.
Prüfen Sie, ob:
- der primäre Endpunkt in Register, Protokoll, Analyseplan und Publikation identisch ist
- der Zeitpunkt nicht geändert wurde
- die Endpunktdefinition nicht nach Einsicht in die Daten modifiziert wurde
- alle vordefinierten wichtigen Endpunkte berichtet werden
Patientenrelevante Endpunkte und Surrogatparameter
Mortalität, Funktion, Symptome, Lebensqualität, Krankenhausaufnahme und schwerwiegende Komplikationen sind in der Regel unmittelbarer relevant als Laborwerte oder bildgebende Parameter. Ein Surrogatendpunkt kann nützlich sein, wenn er für die betreffende Erkrankung, den Wirkmechanismus der Behandlung und die Patientengruppe gut validiert ist. Ein Zusammenhang zwischen Surrogat und klinischem Endpunkt reicht nicht aus. Es muss zudem belegt sein, dass der Effekt der Behandlung auf das Surrogat den Effekt auf den patientenrelevanten Endpunkt verlässlich vorhersagt.
Kombinierte Endpunkte
Kombinierte Endpunkte erhöhen die Zahl der Ereignisse und die statistische Präzision, können aber verschleiern, welche Komponente das Ergebnis treibt. Beurteilen Sie die Komponenten einzeln hinsichtlich:
- Bedeutung für den Patienten
- Häufigkeit
- Richtung und Größe des Effekts
- Abhängigkeit von Entscheidungen der Beurteilenden
Je größer der Unterschied in klinischer Bedeutung und Häufigkeit zwischen den Komponenten, desto weniger aussagekräftig ist der kombinierte Endpunkt. Eine Reduktion der Kombination aus Tod, Infarkt oder Inanspruchnahme medizinischer Versorgung kann vollständig durch mehr Versorgungskontakte getrieben sein, ohne nachgewiesenen Effekt auf Tod oder Infarkt [10].
Nebenwirkungen
Das Fehlen eines statistisch signifikanten Unterschieds bei Nebenwirkungen zeigt selten, dass die Behandlungen gleich sicher sind. Studien werden in der Regel auf Wirksamkeit ausgelegt, nicht auf seltene Schäden. Prüfen Sie aktive gegenüber passiver Erfassung, Definitionen, Expositionsdauer, Zahl der Behandelten und ob Therapieabbrüche einbezogen sind.
Publizierte Artikel können deutlich weniger Informationen zu Schäden enthalten als klinische Studienberichte. In einem Vergleich von fünf Orlistat-Studien waren Methoden und vollständige Nebenwirkungsdaten in den Studienberichten ausführlicher dargestellt als in den Zeitschriftenpublikationen [11]. Für die Sicherheitsbewertung werden daher neben randomisierten Studien häufig Registerdaten, regulatorische Berichte und längere Beobachtungsstudien benötigt.
Besondere Studiendesigns
Nichtunterlegenheit und Äquivalenz
Eine Nichtunterlegenheitsstudie soll zeigen, dass die neue Behandlung nicht um mehr als eine vordefinierte Grenze (Margin) schlechter ist als die Kontrolle. Sie zeigt nicht, dass die Behandlungen identisch sind. Die Margin muss klinisch und methodisch begründet sein.
Die Interpretation sollte auf der Lage des Konfidenzintervalls sowohl zur Nulldifferenz als auch zur Margin beruhen. Sowohl die Intention-to-treat- als auch die Per-Protokoll-Analyse sind wichtig, da mangelnde Adhärenz Behandlungen ähnlicher erscheinen lassen und damit die Schlussfolgerung der Nichtunterlegenheit begünstigen kann.
In einer Auswertung von 209 Nichtunterlegenheits- und Äquivalenzstudien war die Margin in 94 Prozent definiert, aber nur in etwa einem Viertel begründet. Sowohl Intention-to-treat- als auch Per-Protokoll-Analyse wurden in weniger als der Hälfte berichtet, und 21 Prozent der Schlussfolgerungen wurden als falsch oder unverständlich bewertet [12].
Ein nicht signifikantes Ergebnis in einer gewöhnlichen Überlegenheitsstudie beweist weder Nichtunterlegenheit noch Äquivalenz. Für solche Schlussfolgerungen ist eine eigens konzipierte Studie mit vordefinierter Margin und ausreichender Präzision erforderlich.
Subgruppen
Ein Ergebnis, das in einer Subgruppe signifikant ist, in einer anderen aber nicht, zeigt nicht, dass sich der Behandlungseffekt zwischen den Gruppen unterscheidet. Dafür ist ein Interaktionstest erforderlich.
Ein glaubwürdiger Subgruppeneffekt sollte:
- vordefiniert sein
- auf einer biologisch oder klinisch plausiblen Hypothese beruhen
- sich auf wenige getestete Subgruppen beziehen
- eine statistisch gestützte Interaktion zeigen
- über verwandte Endpunkte hinweg konsistent sein
- möglichst in anderen Studien bestätigt werden
Subgruppen auf Basis von Variablen, die nach der Randomisierung erhoben wurden, etwa Adhärenz oder frühes Therapieansprechen, sind besonders anfällig für Bias.
Diagnostische Studien
Von der Sensitivität zur klinischen Entscheidung
Die Sensitivität ist der Anteil der Erkrankten mit positivem Test. Die Spezifität ist der Anteil der Nichterkrankten mit negativem Test. Diese Maße werden weniger direkt von der Prävalenz beeinflusst als die prädiktiven Werte, variieren aber mit Krankheitsspektrum, Schwellenwert, vorangegangener Testung und klinischem Setting [13].
Der positive prädiktive Wert gibt die Wahrscheinlichkeit einer Erkrankung nach positivem Test in der untersuchten Population an. Der negative prädiktive Wert gibt die Wahrscheinlichkeit für das Fehlen einer Erkrankung nach negativem Test an. Beide ändern sich, wenn sich die Prävalenz oder die Patientenselektion ändert.
Likelihood Ratios sind häufig besser übertragbar:
- Positive Likelihood Ratio: Sensitivität / (1 minus Spezifität)
- Negative Likelihood Ratio: (1 minus Sensitivität) / Spezifität
Die Posttest-Odds berechnen sich als Prätest-Odds multipliziert mit der Likelihood Ratio. Eine Wahrscheinlichkeit wird mit der Formel in Odds umgerechnet.
Ein Test mit einer positiven Likelihood Ratio von 10 bewirkt einen deutlich größeren Anstieg der Krankheitswahrscheinlichkeit als ein Test mit einer positiven Likelihood Ratio von 2. Der klinische Nutzen hängt dennoch davon ab, ob die Posttest-Wahrscheinlichkeit eine Schwelle für Behandlung, weitere Diagnostik oder abwartendes Vorgehen überschreitet.
Risiko für Bias in diagnostischen Studien
STARD empfiehlt eine transparente Berichterstattung unter anderem über Patientenselektion, Indextest, Referenzstandard, Schwellenwerte, Verblindung, unklare Ergebnisse und Patientenfluss [14]. QUADAS-2 gliedert die Bewertung in vier Domänen: Patientenselektion, Indextest, Referenzstandard sowie Fluss und Zeitablauf [15].
Seien Sie besonders aufmerksam bei:
- Fall-Kontroll-Design mit schwer erkrankten Fällen und gesunden Kontrollen
- Ausschluss schwer klassifizierbarer Patienten
- Anwendung des Referenzstandards nur bei Testpositiven
- unterschiedlichen Referenzstandards in verschiedenen Gruppen
- Kenntnis des Indextests bei der Interpretation des Referenzstandards
- datengetriebener Wahl des optimalen Schwellenwerts
- langer oder variierender Zeit zwischen den Tests
Die AUC einer ROC-Kurve fasst die Diskrimination über viele mögliche Schwellenwerte zusammen, legt aber nicht fest, welcher Schwellenwert klinisch geeignet ist, und berücksichtigt nicht direkt die Konsequenzen falsch positiver und falsch negativer Ergebnisse.
Prognosemodelle und Risikovorhersage
Ein Prognosemodell sollte nicht allein nach statistisch signifikanten Prädiktoren beurteilt werden. Wichtiger sind:
- Diskrimination, die Fähigkeit des Modells, Risiken in eine Rangfolge zu bringen
- Kalibrierung, die Übereinstimmung zwischen vorhergesagtem und beobachtetem Risiko
- klinischer Nutzen bei relevanten Entscheidungsschwellen
- interne und externe Validierung
- Umgang mit fehlenden Daten
- Risiko für Overfitting
Ein hoher C-Index kann mit schlechter Kalibrierung einhergehen. Ein Modell kann Patienten also gut in eine Rangfolge bringen, ihr absolutes Risiko aber systematisch über- oder unterschätzen. TRIPOD legt Berichtsanforderungen für Entwicklung, Validierung und Aktualisierung diagnostischer und prognostischer Modelle fest [16].
Ergebnisse allein aus dem Entwicklungsdatensatz sind häufig zu optimistisch. Eine zufällige Aufteilung eines kleinen Datensatzes in Trainings- und Testteil ist in der Regel weniger effizient, als den gesamten Datensatz mit Bootstrap oder Kreuzvalidierung zur internen Validierung zu nutzen. Die klinische Anwendung erfordert zudem eine externe Validierung in einem anderen Zeitraum, Setting oder einer anderen Population.
Beobachtungsstudien
Assoziation ist nicht automatisch Kausalität
Confounding entsteht, wenn ein Faktor sowohl die Exposition als auch den Endpunkt beeinflusst. Beim Confounding by Indication erhalten beispielsweise kränkere Patienten häufiger eine Behandlung, wodurch die Behandlung schädlich erscheinen kann. Umgekehrt kann die Selektion gesünderer behandelter Patienten einen Scheinnutzen erzeugen.
Statistische Adjustierung beseitigt nur Confounding durch Variablen, die ausreichend gut gemessen und korrekt modelliert wurden. Propensity Score, Matching und Regressionsanalyse machen aus einer Beobachtungsstudie keine randomisierte Studie.
Beurteilen Sie insbesondere:
- wie Behandelte und Unbehandelte ausgewählt wurden
- ob wichtige prognostische Faktoren vor der Behandlung erhoben wurden
- Balance vor und nach Adjustierung
- Überlappung der Behandlungswahrscheinlichkeit
- Fehlklassifikation von Exposition und Endpunkt
- Negativkontrolle oder andere Sensitivitätsanalysen
- ob die Ergebnisse robust gegenüber unbekanntem Confounding sind
Zeitbezogener Bias
Immortal Time Bias entsteht, wenn ein Patient einen bestimmten Zeitraum überleben muss, um als exponiert klassifiziert zu werden, und dieser Zeitraum zugleich fälschlich der exponierten Gruppe zugerechnet wird. Dies kann einen künstlichen Überlebensvorteil erzeugen.
Ein nützlicher Ansatz zur Prüfung einer Beobachtungsstudie zu einer Behandlung besteht darin, die hypothetische randomisierte Zielstudie (Target Trial) zu formulieren, die die Analyse nachzubilden versucht. Eignung, Behandlungszuteilung und Beginn der Nachbeobachtung müssen zusammenfallen. Fehlende Synchronisation kann Immortal Time Bias und Selektionsbias erzeugen, selbst wenn Confounding ansonsten gut adressiert wurde [17].
Systematische Übersichtsarbeiten und Metaanalysen
Ist die Übersichtsarbeit wirklich systematisch?
PRISMA 2020 verlangt unter anderem die Darstellung von Suchstrategien, Auswahl, Risiko für Bias, Synthesemethoden, Heterogenität, Sensitivitätsanalysen und Vertrauenswürdigkeit der Evidenz [3]. PRISMA bewertet die Berichterstattung, nicht die methodische Qualität.
AMSTAR 2 kann zur kritischen Bewertung systematischer Übersichtsarbeiten eingesetzt werden. Besonders wichtige Domänen sind ein vorab registriertes Protokoll, eine ausreichende Literatursuche, die Begründung ausgeschlossener Studien, die Bewertung des Risikos für Bias, eine angemessene Metaanalyse und die Berücksichtigung von Publikationsbias. AMSTAR 2 sollte nicht auf einen einfachen Summenwert reduziert werden, da ein kritischer Mangel durch viele weniger gut umgesetzte Einzelpunkte verdeckt werden kann [18].
Forest Plot interpretieren
Punktschätzer und Konfidenzintervall jeder einzelnen Studie sollten vor dem gepoolten Ergebnis gelesen werden. Fragen Sie:
- Weisen die Effekte in dieselbe Richtung?
- Überlappen die Intervalle?
- Dominiert eine einzelne große Studie?
- Fallen kleine Studien günstiger aus?
- Sind Interventionen, Populationen und Endpunkte ausreichend ähnlich?
- Ist der gepoolte Effekt klinisch nachvollziehbar?
Ein Fixed-Effect-Modell nimmt einen gemeinsamen zugrunde liegenden Effekt für alle Studien an. Ein Random-Effects-Modell erlaubt, dass der wahre Effekt zwischen den Studien variiert. Random Effects lösen keine klinische Heterogenität und können kleinen Studien ein relativ größeres Gewicht geben.
Heterogenität
Cochrans Q prüft, ob die Variation größer ist als durch Zufall zu erwarten, hat aber bei wenigen Studien eine geringe Power. schätzt den Anteil der beobachteten Variation, der auf Unterschiede zwischen den Studien statt auf Stichprobenvariation zurückzuführen ist. Der Wert sollte nicht mechanisch interpretiert werden. Die klinische Bedeutung hängt von Effektmaß, Präzision, Anzahl der Studien und Richtung der Variation ab.
Tau-Quadrat beschreibt die Varianz zwischen den wahren Studieneffekten auf der Skala der Analyse. Ein Prädiktionsintervall schätzt, in welchem Bereich der Effekt in einer neuen vergleichbaren Studie liegen kann. Bei erheblicher Heterogenität ist das Prädiktionsintervall häufig klinisch aussagekräftiger als das Konfidenzintervall um den mittleren Effekt.
Small-Study-Effekte und Publikationsbias
Eine Asymmetrie im Funnel Plot kann auf Publikationsbias, methodische Mängel, klinische Heterogenität oder Zufall zurückgehen. Das Fehlen einer Asymmetrie schließt Publikationsbias nicht aus, insbesondere wenn nur wenige Studien eingeschlossen sind. AMSTAR 2 gibt an, dass ein Funnel Plot für eine sinnvolle Beurteilung normalerweise mindestens etwa zehn Studien erfordert [18].
In einer metaepidemiologischen Analyse intensivmedizinischer Studien berichteten kleine Studien größere günstige Effekte als große Studien. Kleine Studien wiesen zudem schlechter berichtete Sequenzgenerierung, verdeckte Zuteilung, Verblindung und Intention-to-treat-Analyse auf [19]. Ein gepooltes positives Ergebnis, das vollständig von kleinen Studien getragen wird, sollte daher als unsicher gelten, bis es in größeren, gut durchgeführten Studien bestätigt wurde.
Von der Studie zum Patienten
Interne Validität kommt vor externer Validität. Ein stark verzerrtes Ergebnis wird nicht klinisch verwertbar, nur weil die Studienpatienten dem aktuellen Patienten ähneln. Ist die interne Validität akzeptabel, sollte Folgendes verglichen werden:
| Studienmerkmal | Klinische Frage |
|---|---|
| Alter und Gebrechlichkeit | Ist der Patient älter, gebrechlicher oder stärker multimorbide? |
| Schweregrad der Erkrankung | Ist das Ausgangsrisiko vergleichbar? |
| Komorbidität | Wurden häufige Begleiterkrankungen ausgeschlossen? |
| Begleitbehandlung | Entspricht die Kontrollgruppe der heutigen Standardtherapie? |
| Behandlungsintensität | Sind Dosis, Monitoring und Adhärenz erreichbar? |
| Endpunkt | Ist er für den Patienten relevant? |
| Nachbeobachtung | Ist sie für den erwarteten Nutzen und Schaden ausreichend? |
| Versorgungssetting | Lassen sich die Ergebnisse auf das schwedische Gesundheitswesen übertragen? |
Nationale Behandlungseinschränkungen, Erstattungsregelungen und organisatorische Rahmenbedingungen können von internationalen Studien abweichen. Solche Unterschiede müssen anhand aktueller schwedischer Empfehlungen und der Produktinformation geprüft werden, bevor das Ergebnis in die Versorgung umgesetzt wird.
Eine klinisch verwertbare Schlussfolgerung kann wie folgt formuliert werden:
Bei Patienten, die der untersuchten Population ähneln, verringerte die Behandlung den primären patientenrelevanten Endpunkt relativ, der absolute Effekt hing jedoch vom Ausgangsrisiko ab. Das Konfidenzintervall war mit X bis Y Ereignissen weniger pro 1 000 Behandelten über Z Jahre vereinbar. Das Risiko für Bias war niedrig oder moderat, die Übertragbarkeit war jedoch durch eine kurze Nachbeobachtung und wenige gebrechliche Patienten eingeschränkt.
Eine solche Formulierung ist aussagekräftiger als die Feststellung, die Behandlung sei wirksam, positiv oder statistisch signifikant gewesen.
Checkliste für Journal Club oder klinische Entscheidung
- Ist die Fragestellung relevant und klar definiert?
- Ist das Studiendesign für die Fragestellung geeignet?
- Was war der vordefinierte primäre Endpunkt?
- Ist der Endpunkt patientenrelevant?
- Waren Randomisierung, verdeckte Zuteilung und Verblindung angemessen?
- Wie wurden Loss to Follow-up, Crossover und fehlende Daten behandelt?
- Stimmen Artikel, Protokoll, Register und Analyseplan überein?
- Wie groß ist der Effekt relativ und absolut?
- Wie breit ist das Konfidenzintervall?
- Schließt das Intervall sowohl keinen Effekt als auch einen klinisch bedeutsamen Effekt aus?
- Wurden multiple Endpunkte, Subgruppen oder Zeitpunkte analysiert?
- Wird ein kombinierter Endpunkt von weniger wichtigen Komponenten getrieben?
- Sind die Sicherheitsdaten ausreichend?
- Ist das Ergebnis mit anderen Studien konsistent?
- Gibt es Heterogenität, Small-Study-Effekte oder Publikationsbias?
- Sind Finanzierung und Interessen der Autoren transparent?
- Ähnelt die Studienpopulation dem aktuellen Patienten?
- Wie verändert sich der absolute Nutzen beim Ausgangsrisiko des Patienten?
- Sind Behandlungslast und Schadensrisiko akzeptabel?
- Wie hoch ist die Vertrauenswürdigkeit der Gesamtevidenz?
Quellen
- Moher D et al. CONSORT 2010 explanation and elaboration: updated guidelines for reporting parallel group randomised trials. International Journal of Surgery 2012. PMID: 22036893
- Vandenbroucke JP et al. Strengthening the Reporting of Observational Studies in Epidemiology (STROBE): explanation and elaboration. PLoS Medicine 2007. PMID: 17941715
- Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
- Balshem H et al. GRADE guidelines: 3. Rating the quality of evidence. Journal of Clinical Epidemiology 2011. PMID: 21208779
- Page MJ et al. Empirical Evidence of Study Design Biases in Randomized Trials: Systematic Review of Meta-Epidemiological Studies. PLoS One 2016. PMID: 27398997
- Khan MS et al. Fragility Index in Cardiovascular Randomized Controlled Trials. Circulation: Cardiovascular Quality and Outcomes 2019. PMID: 31822121
- Lundh A et al. Industry sponsorship and research outcome. Cochrane Database of Systematic Reviews 2017. PMID: 28207928
- Austin PC, Fine JP. Accounting for competing risks in randomized controlled trials: a review and recommendations for improvement. Statistics in Medicine 2017. PMID: 28102550
- Ito C et al. Misleading Reporting (Spin) in Noninferiority Randomized Clinical Trials in Oncology With Statistically Not Significant Results: A Systematic Review. JAMA Network Open 2021. PMID: 34874407
- McCoy CE. Understanding the Use of Composite Endpoints in Clinical Trials. Western Journal of Emergency Medicine 2018. PMID: 30013696
- Hodkinson A et al. Reporting of harms outcomes: a comparison of journal publications with unpublished clinical study reports of orlistat trials. Trials 2016. PMID: 27103582
- Schiller P et al. Quality of reporting of clinical non-inferiority and equivalence randomised trials: update and extension. Trials 2012. PMID: 23157733
- Fischer JE et al. A readers' guide to the interpretation of diagnostic test properties: clinical example of sepsis. Intensive Care Medicine 2003. PMID: 12734652
- Cohen JF et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
- Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
- Collins GS et al. Transparent reporting of a multivariable prediction model for individual prognosis or diagnosis (TRIPOD): the TRIPOD statement. BMJ 2015. PMID: 25569120
- Hernán MA et al. Specifying a target trial prevents immortal time bias and other self-inflicted injuries in observational analyses. Journal of Clinical Epidemiology 2016. PMID: 27237061
- Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
- Zhang Z et al. Small studies may overestimate the effect sizes in critical care meta-analyses: a meta-epidemiological study. Critical Care 2013. PMID: 23302257