Evidenzbasierte Medizin: kritische Bewertung von Studien

Zusammenfassung

Kritische Bewertung bedeutet zu beurteilen, ob eine Studie eine klinisch relevante Frage beantwortet, ob das Ergebnis systematisch verzerrt sein kann, wie groß und wie präzise der Effekt ist und ob das Ergebnis auf den jeweiligen Patienten übertragbar ist. Beginnen Sie nicht mit der Schlussfolgerung oder dem p-Wert. Identifizieren Sie zunächst Fragestellung, Studiendesign, Population, Intervention oder Exposition, Vergleich, Endpunkte und Nachbeobachtungszeit. Prüfen Sie anschließend die interne Validität, Effektmaße und Präzision, danach die externe Validität und die Gesamtevidenz.

Bei randomisierten Studien lauten die zentralen Fragen, ob die Randomisierungssequenz korrekt erzeugt wurde, ob die Zuteilung verdeckt erfolgte (Allocation Concealment), ob Abweichungen von der zugewiesenen Behandlung auftraten, wie mit Studienabbrechern umgegangen wurde, ob die Endpunkterhebung zuverlässig war und ob die berichteten Analysen vorab festgelegt waren. Bei Beobachtungsstudien kommen vor allem Selektionsbias, Confounding, Fehlklassifikation und zeitbezogene Biasformen hinzu. Diagnostische Studien müssen anhand von Patientenauswahl, Index- und Referenztest, Verblindung, Schwellenwerten sowie Patientenfluss beurteilt werden. Systematische Übersichtsarbeiten erfordern eine reproduzierbare Literatursuche, eine transparente Studienauswahl, eine angemessene Bewertung des Verzerrungsrisikos und eine plausible Synthese.

Statistische Signifikanz ist nicht gleichbedeutend mit klinischer Relevanz. Interpretieren Sie Punktschätzer stets zusammen mit Konfidenzintervallen und absoluten Effekten. Ein nicht signifikantes Ergebnis belegt nicht automatisch Gleichwertigkeit. Eine große Stichprobe kann ein präzises, aber verzerrtes Ergebnis liefern, während eine kleine Stichprobe trotz guten Studiendesigns ein unsicheres Ergebnis liefern kann. Schließlich sind die Studienergebnisse mit der übrigen Evidenz, dem Ausgangsrisiko des Patienten, seinen Präferenzen, der Behandlungslast, den Nebenwirkungen, den Ressourcen und dem schwedischen Versorgungskontext abzuwägen.

Von der klinischen Frage zum Bewertungsplan

Die Frage formulieren, bevor der Artikel bewertet wird

Eine brauchbare Bewertung beginnt mit einer beantwortbaren Frage. Für Therapieeffekte wird üblicherweise PICO verwendet:

Komponente Frage
Population Welche Patienten betrifft die Frage?
Intervention Welche Behandlung, Strategie oder Maßnahme wird bewertet?
Comparator Womit wird die Intervention verglichen?
Outcome Welche patientenrelevanten Wirkungen und Schäden sind wichtig?
Zeit Wie lange müssen Behandlung und Nachbeobachtung dauern, damit der Endpunkt aussagekräftig ist?

Bei diagnostischen Fragen muss zusätzlich der Indextest, der Referenzstandard, die vorgesehene klinische Rolle und die Stelle im Versorgungsablauf angegeben werden, an der der Test eingesetzt werden soll. Bei Prognosefragen werden Population, prognostischer Faktor oder Modell, Endpunkt und Zeithorizont angegeben. Bei Fragen zu Ätiologie oder Schaden werden Exposition, relevanter Vergleich und mögliche Confounder spezifiziert.

Derselbe Artikel kann für eine Frage relevant und für eine andere ungeeignet sein. Eine placebokontrollierte Wirksamkeitsstudie kann zeigen, dass eine Behandlung eine biologische Wirkung hat, muss aber nicht zeigen, ob sie der schwedischen Standardbehandlung überlegen ist. Eine Studie zur diagnostischen Genauigkeit kann zeigen, wie gut ein Test eine Erkrankung klassifiziert, nicht aber, ob der Test die Patientenergebnisse verbessert.

Das Studiendesign danach bestimmen, was tatsächlich gemacht wurde

Verlassen Sie sich nicht allein auf die Bezeichnung der Autoren. Beurteilen Sie, wie die Teilnehmer ausgewählt wurden, wie die Vergleichsgruppen gebildet wurden, wann Exposition und Endpunkt gemessen wurden und wie die Nachbeobachtung erfolgte.

Fragetyp Häufig geeignetes Design Hauptgefährdungen der Validität
Therapieeffekt Randomisierte kontrollierte Studie Mängel der Randomisierung, Abweichungen, Studienabbrüche, selektives Berichten
Seltener oder langfristiger Schaden Kohorte, Fall-Kontroll-Studie, Registerstudie Confounding, Selektion, Fehlklassifikation, zeitbezogene Biasformen
Diagnostische Genauigkeit Querschnittsstudie oder Kohorte, in der dieselben Patienten Index- und Referenztest erhalten Spektrumbias, Verifikationsbias, ungeeigneter Referenzstandard
Prognose Inzeptionskohorte mit relevanter Nachbeobachtung Selektiver Einschluss, Studienabbrüche, Überanpassung
Prävalenz Repräsentative Querschnittsstudie Stichprobenfehler, Nichtteilnahme, Messfehler
Gesamtevidenz zur Therapie Systematische Übersichtsarbeit, gegebenenfalls mit Metaanalyse Unvollständige Suche, Bias in den Primärstudien, ungeeignete Zusammenfassung

Berichtsleitlinien helfen dem Leser, die nötigen Informationen zu finden. CONSORT 2025 umfasst 30 Berichtspunkte für randomisierte Studien und betont unter anderem Registrierung, Protokoll, statistischen Analyseplan, Datenmanagement, Studienabbrüche und Nebenwirkungen [1]. STROBE umfasst Kohorten-, Fall-Kontroll- und Querschnittsstudien und unterstreicht, dass Population, Datenerhebung, Variablen, mögliche Biasquellen und Analyse klar beschrieben werden müssen [2]. STARD erfüllt die entsprechende Funktion für diagnostische Studien [3], während PRISMA 2020 27 Berichtspunkte für systematische Übersichtsarbeiten enthält [4].

Diese Leitlinien sind keine Qualitätsinstrumente. Eine vollständige Berichterstattung macht eine Studie bewertbar, garantiert aber nicht, dass die Methodik korrekt ist. Eine mangelhafte Berichterstattung bedeutet dagegen, dass ein Verzerrungsrisiko häufig nicht ausgeschlossen werden kann.

flowchart TD
A["Klinische Frage und<br>wichtige Endpunkte formulieren"] --> B["Ermitteln, was die Forscher<br>tatsächlich verglichen haben"]
B --> C["Interne Validität und<br>Verzerrungsrisiko beurteilen"]
C --> D["Effektgröße und<br>Präzision interpretieren"]
D --> E["Alternative Analysen und<br>selektives Berichten prüfen"]
E --> F["Übertragbarkeit auf Patient<br>und Versorgungskontext beurteilen"]
F --> G["Mit übriger Evidenz abwägen:<br>Nutzen, Schaden und Ressourcen"]

Gemeinsame Bewertung aller Studien

Forschungsfrage, Protokoll und Vorabregistrierung

Prüfen Sie, ob Hypothese, primärer Endpunkt, Nachbeobachtungszeit und Analyse festgelegt wurden, bevor die Daten ausgewertet wurden. Bei randomisierten Studien sollte die Registrierung vor Einschluss des ersten Teilnehmers erfolgt sein. Vergleichen Sie die Publikation mit Studienprotokoll, Registereintrag und statistischem Analyseplan. Prüfen Sie, ob:

  • der primäre Endpunkt ausgetauscht wurde
  • der Zeitpunkt der Primäranalyse geändert wurde
  • Endpunkte hinzugefügt oder entfernt wurden
  • Subgruppen oder Adjustierungsvariablen ausgewählt wurden, nachdem die Ergebnisse bekannt waren
  • die Studie ohne klar vorab festgelegte Regeln vorzeitig beendet wurde
  • die Analyse ohne überzeugende Begründung von der geplanten abweicht

Eine Abweichung muss nicht unangemessen sein. Klinische Entwicklungen oder unerwartete Datenprobleme können eine Änderung rechtfertigen. Problematisch ist eine undokumentierte, ergebnisgesteuerte Änderung, die das Risiko erhöht, dass ein Zufallsbefund als bestätigende Evidenz dargestellt wird.

Population und Rekrutierung

Beschreiben Sie die Ausgangspopulation, bevor Sie die Studienpopulation beurteilen. Fragen Sie, welche Patienten hätten eingeschlossen werden können, welche tatsächlich auf eine Teilnahme geprüft wurden und welche schließlich ausgewertet wurden. Eine Rekrutierung an hochspezialisierten Zentren kann eine hohe Behandlungsqualität, aber eine begrenzte Generalisierbarkeit bedeuten. Eine Rekrutierung über Anzeigen oder freiwillige Teilnahme kann besonders motivierte und gesundheitsbewusste Personen selektieren.

Prüfen Sie:

  • Ein- und Ausschlusskriterien
  • Rekrutierungsland, Versorgungsstufe und Zeitraum
  • den Anteil der angefragten Personen, die eingeschlossen wurden
  • Komorbidität, Alter, Geschlechterverteilung und Schweregrad der Erkrankung
  • vorherige und begleitende Behandlung
  • ob ältere, gebrechliche oder schwangere Personen oder andere wichtige Gruppen ausgeschlossen wurden
  • ob die diagnostischen Kriterien der klinischen Praxis entsprechen

Eine Behandlung kann bei unterschiedlichem Ausgangsrisiko denselben relativen Effekt, aber einen sehr unterschiedlichen absoluten Nutzen haben. Deshalb ist das Ausgangsrisiko des Patienten für die Anwendung zentral.

Intervention, Vergleich und Begleitbehandlung

Die Intervention muss so ausführlich beschrieben sein, dass sie reproduziert werden kann. Bei Arzneimitteln sind Dosis, Applikationsweg, Behandlungsdauer, Dosisanpassung und Adhärenz erforderlich. Bei Chirurgie, Physiotherapie oder komplexen Versorgungsprogrammen werden Informationen zu Durchführenden, Schulung, Komponenten und tatsächlicher Umsetzung benötigt. TIDieR wurde entwickelt, um die Beschreibung und Reproduzierbarkeit solcher Interventionen zu verbessern [5].

Die Vergleichsbehandlung ist ebenso wichtig wie die Intervention. Placebo kann sinnvoll sein, wenn keine wirksame Standardbehandlung existiert, reicht aber nicht aus, wenn es um die Wahl zwischen etablierten Behandlungen geht. Eine zu niedrig dosierte oder falsch angewendete aktive Kontrolle kann den relativen Nutzen der neuen Behandlung überschätzen.

Beurteilen Sie auch die Begleitbehandlung. Erhalten die Gruppen unterschiedliche Rescue-Therapie, Rehabilitation, Nachsorge oder Diagnostik, kann der Unterschied im Endpunkt nicht sicher der beabsichtigten Intervention zugeschrieben werden.

Endpunkte und Nachbeobachtungszeit

Priorisieren Sie patientenrelevante Endpunkte wie Überleben, Symptome, Funktion, Lebensqualität, Krankenhausaufnahme und schwerwiegende Komplikationen. Biomarker und radiologische Messgrößen können nützlich sein, aber ein Surrogatendpunkt muss für die jeweilige Erkrankung, den Wirkmechanismus der Behandlung und die Patientenpopulation validiert sein. Eine Behandlung kann einen Laborwert verbessern, ohne die Gesundheit der Patienten zu verbessern.

Prüfen Sie, wie der Endpunkt definiert und gemessen wurde:

  • War die Definition klinisch aussagekräftig?
  • War die Messmethode validiert?
  • War der Endpunkt selbstberichtet oder beurteilerabhängig?
  • Waren die Beurteiler verblindet?
  • Wurde der Endpunkt in den Gruppen gleich häufig und auf dieselbe Weise erhoben?
  • War die Nachbeobachtung lang genug für Nutzen und Schaden?
  • Enthielt ein kombinierter Endpunkt Komponenten von sehr unterschiedlicher klinischer Bedeutung?

Ein kombinierter Endpunkt kann von der häufigsten, aber am wenigsten schwerwiegenden Komponente dominiert werden. Der Bericht sollte daher sowohl den kombinierten Endpunkt als auch jede Komponente einzeln darstellen.

Randomisierte Therapiestudien

Randomisierung verringert im Erwartungswert sowohl bekanntes als auch unbekanntes Confounding, jedoch nur, wenn die Sequenz echt zufällig ist und die Zuteilung nicht vorhergesagt werden kann. RoB 2 bewertet fünf Domänen: den Randomisierungsprozess, Abweichungen von den beabsichtigten Interventionen, fehlende Endpunktdaten, die Endpunkterhebung und die Selektion des berichteten Ergebnisses [6].

Randomisierungsprozess und verdeckte Zuteilung

Prüfen Sie, wie die Sequenz erzeugt wurde. Computergenerierte Zufallszahlen und zentrale Randomisierung sind in der Regel geeignet. Alternierung, Geburtsdatum, Aktennummer oder Wochentag sind vorhersagbar und stellen keine sichere Randomisierung dar.

Verdeckte Zuteilung bedeutet, dass die Person, die den Teilnehmer einschließt, die nächste Zuteilung nicht kennen kann. Dies ist von der Verblindung nach der Randomisierung zu unterscheiden. Eine zentrale web- oder telefonbasierte Zuteilung bietet häufig einen besseren Schutz als lokal aufbewahrte Umschläge. Konnte die Zuteilung vorhergesehen werden, kann die rekrutierende Person beeinflussen, welche Patienten in welche Gruppe gelangen.

Sehen Sie sich die Baseline-Tabelle an, verwenden Sie aber nicht allein Signifikanztests zur Beurteilung der Randomisierung. Zufällige Ungleichgewichte können auftreten. Große oder unwahrscheinliche Unterschiede in mehreren prognostisch wichtigen Variablen können dagegen eine genauere Prüfung des Prozesses rechtfertigen.

Verblindung und Abweichungen von der Behandlung

Verblindung verringert das Risiko, dass Erwartungen die Behandlung, die Begleitbehandlung, Studienabbrüche oder die Endpunkterhebung beeinflussen. Ihre Bedeutung hängt vom Endpunkt ab. Die Gesamtmortalität ist weniger anfällig für Beurteilereinflüsse als Schmerz, Funktionsbewertung oder die Entscheidung zur Krankenhausaufnahme.

Ist eine Verblindung nicht möglich, fragen Sie, ob:

  • die Gruppen unterschiedliche Betreuung oder Begleitbehandlung erhielten
  • die Adhärenz durch die Kenntnis der Behandlung beeinflusst wurde
  • die Abweichungen ausgewogen waren
  • der Endpunkt von einem unabhängigen, verblindeten Komitee beurteilt wurde
  • die Analyse den Effekt der Zuteilung oder den Effekt der tatsächlich erhaltenen Behandlung schätzte

Intention-to-treat und Per-Protocol

Eine Intention-to-treat-Analyse belässt die Teilnehmer in der Gruppe, der sie randomisiert zugeteilt wurden. Sie bewahrt die durch die Randomisierung erzielte Vergleichbarkeit und schätzt in der Regel den Effekt einer Behandlungsstrategie unter Studienbedingungen. Eine As-treated-Analyse durchbricht die Randomisierung und kann Confounding wieder einführen.

Eine Per-Protocol-Analyse schließt nur Teilnehmer ein, die das Protokoll nach vorab festgelegten Kriterien eingehalten haben. Sie kann informativ sein, ist aber anfällig für Selektion, da die Adhärenz häufig mit der Prognose zusammenhängt. In Überlegenheitsstudien ist Intention-to-treat in der Regel die primäre Analyse. In Nichtunterlegenheitsstudien sind sowohl Intention-to-treat als auch Per-Protocol wichtig, da Abweichungen und Behandlungswechsel (Crossover) die Gruppen einander angleichen und damit die Schlussfolgerung der Nichtunterlegenheit begünstigen können.

Nichtunterlegenheit und Äquivalenz

Nichtunterlegenheit bedeutet, dass die neue Behandlung nicht in inakzeptablem Ausmaß schlechter ist als die Kontrolle. Das ist nicht dasselbe wie das Fehlen eines statistisch signifikanten Unterschieds. Prüfen Sie:

  1. Dass die Nichtunterlegenheitsgrenze vor Studienbeginn definiert wurde.
  2. Dass die Grenze klinisch und empirisch begründet ist.
  3. Dass die aktive Kontrolle zuvor in einer ähnlichen Population als wirksam nachgewiesen wurde.
  4. Dass Behandlung, Adhärenz und Endpunkterhebung gut genug waren, um Unterschiede erkennen zu können.
  5. Dass das Konfidenzintervall vollständig auf der richtigen Seite der Grenze liegt.
  6. Dass sowohl der Nutzen als auch mögliche Vorteile, etwa weniger Nebenwirkungen oder eine einfachere Anwendung, bewertet werden.

Äquivalenz erfordert, dass das gesamte Konfidenzintervall innerhalb von zwei vorab festgelegten Grenzen liegt. Das Fehlen eines signifikanten Unterschieds reicht nicht aus.

Studienabbrüche und fehlende Daten

Berichten Sie Studienabbrüche getrennt für jede Gruppe und für jeden zentralen Endpunkt. Beurteilen Sie sowohl den Anteil als auch die Gründe. Fünf Prozent Studienabbrüche können gravierend sein, wenn nur wenige Ereignisse aufgetreten sind und die Abbrüche mit der Prognose zusammenhängen. Ein größerer Anteil an Abbrüchen kann weniger verzerrend sein, wenn die Gründe unabhängig von Behandlung und Endpunkt sind.

Eine Complete-Case-Analyse ist nur unter restriktiven Annahmen sicher. Moderne Verfahren umfassen unter anderem multiple Imputation, likelihoodbasierte Modelle und Gewichtung. Keine Methode stellt Informationen wieder her, die nie erhoben wurden. Die Annahmen sollten klinisch plausibel sein, und Sensitivitätsanalysen sollten zeigen, wie sich die Schlussfolgerung ändert, wenn fehlende Endpunkte in einer Gruppe schlechter ausfallen. Eine methodische Übersichtsarbeit aus dem Jahr 2024 ergab, dass viele Studien noch immer Methoden verwenden, die in der Praxis die starke Annahme erfordern, dass die Daten vollständig zufällig fehlen [7].

Selektives Berichten und Subgruppen

Ein primärer Endpunkt sollte vorab festgelegt sein. Viele sekundäre Endpunkte, Zeitpunkte, Subgruppen und Modellvarianten erhöhen die Wahrscheinlichkeit zufällig positiver Ergebnisse.

Ein glaubwürdiger Subgruppeneffekt sollte möglichst:

  • vorab festgelegt und auf wenige Hypothesen beschränkt sein
  • biologisch oder klinisch plausibel sein
  • durch einen formalen Interaktionstest belegt sein
  • innerhalb von und zwischen Studien konsistent sein
  • auf ausreichend vielen Teilnehmern und Ereignissen beruhen
  • nicht allein auf Signifikanz in einer Gruppe und fehlender Signifikanz in einer anderen beruhen

Der Unterschied zwischen einem signifikanten und einem nicht signifikanten Ergebnis ist nicht notwendigerweise signifikant. In einer Analyse von 928 Cochrane-Reviews waren altersbezogene Subgruppenanalysen in 20,4 Prozent geplant, wurden aber nur in einer kleinen Minderheit durchgeführt. Mehreren Analysen fehlte ein formaler Interaktionstest, und die beobachteten Interaktionen waren nur schwach belegt [8].

Schäden und Nebenwirkungen

Wirksamkeitsstudien haben häufig eine unzureichende statistische Power und eine zu kurze Nachbeobachtung für seltene oder späte Schäden. Prüfen Sie, wie Nebenwirkungen erfragt, definiert, kodiert und zugeordnet wurden. Eine aktive, systematische Überwachung erfasst mehr Ereignisse als Spontanmeldungen.

Der Bericht sollte für jede Gruppe die Anzahl der Teilnehmer mit mindestens einem Ereignis, die Anzahl der Ereignisse, den Schweregrad, Therapieabbrüche, schwerwiegende Ereignisse und Todesfälle angeben. CONSORT Harms empfiehlt eine integrierte und vorab festgelegte Berichterstattung über Nutzen und Schaden [9]. In einer systematischen Übersichtsarbeit zu 61 randomisierten Impfstoffstudien berichteten alle über Todesfälle und schwerwiegende Nebenwirkungen, aber nur sechs beschrieben, wie mit wiederkehrenden Nebenwirkungen umgegangen wurde [10].

Beobachtungsstudien

Beobachtungsstudien sind für viele Fragen zu Prognose, Ätiologie, seltenen Schäden und Behandlung in der klinischen Routine unverzichtbar. Sie können sehr groß und präzise sein, doch Präzision beseitigt keine systematischen Fehler.

Selektion und Vergleichbarkeit

In einer Kohortenstudie sollen Exponierte und Nichtexponierte vergleichbare Personen zu einem klar definierten Startzeitpunkt repräsentieren. In einer Fall-Kontroll-Studie sollen die Kontrollen die Population repräsentieren, aus der die Fälle hervorgegangen sind. In Querschnittsstudien ist die zeitliche Abfolge von Exposition und Erkrankung häufig unklar.

Prüfen Sie, ob Einschluss, Behandlung oder weitere Nachbeobachtung von der Prognose abhängen. Beispiele sind die Selektion von Personen, die bis zum Studieneinschluss überlebt haben, der Ausschluss schwer kranker Patienten oder ein informativer Loss to Follow-up.

Confounding

Ein Confounder ist sowohl mit der Exposition als auch mit dem Endpunkt assoziiert, ohne eine Folge der Exposition zu sein. Confounding by Indication ist besonders bedeutsam, wenn kränkere Patienten häufiger eine bestimmte Behandlung erhalten. Eine statistisch adjustierte Beobachtungsstudie ist nicht automatisch kausal interpretierbar. Eine Adjustierung kann nur Variablen berücksichtigen, die ausreichend gut gemessen und korrekt modelliert wurden.

Prüfen Sie:

  • ob wichtige Confounder anhand klinischen Wissens identifiziert wurden
  • wann und wie sie gemessen wurden
  • ob Variablen nach Behandlungsbeginn fälschlicherweise herausadjustiert wurden
  • ob die Gruppen eine überlappende Wahrscheinlichkeit hatten, die Behandlung zu erhalten
  • ob die Balance nach Matching oder Gewichtung berichtet wurde
  • ob Sensitivitätsanalysen für unbekanntes Confounding durchgeführt wurden

Ein Scoping-Review von 117 Methodenartikeln zu Sekundärdatenbanken des Gesundheitswesens identifizierte Confounding, Selektion und Messfehler als die häufigsten Problembereiche. Besonders hervor traten Confounding by Indication, Residual Confounding, Fehlklassifikation von Endpunkten und Immortal Time Bias [11].

Propensity Scores können für Matching, Stratifizierung, Gewichtung oder Adjustierung verwendet werden, machen unbekannte Confounder jedoch nicht vergleichbar. In einer Übersichtsarbeit zu 127 Vergleichen zwischen Propensity-Score-Analysen und randomisierten Studien war der Unterschied zwischen den Designs in 54 Prozent der Vergleiche groß [12].

Messfehler und Fehlklassifikation

Diagnosen, Arzneimittelexpositionen und Endpunkte in administrativen Registern wurden häufig für Versorgung oder Abrechnung erstellt, nicht für die Forschung. Prüfen Sie den positiven und negativen prädiktiven Wert der Kodierungen im relevanten Setting. Eine Verordnung bedeutet nicht, dass das Arzneimittel abgeholt wurde, und eine Abgabe bedeutet nicht, dass es eingenommen wurde.

Nicht differenzielle Fehlklassifikation führt nicht immer in Richtung Null, insbesondere nicht bei mehreren Kategorien, abhängigen Messfehlern oder adjustierten Modellen. Differenzielle Fehlklassifikation kann das Ergebnis in jede Richtung verzerren.

Zeitbezogene Biasformen

Der Beginn von Exposition, Vergleich und Nachbeobachtung muss auf einem gemeinsamen, klinisch sinnvollen Zeitpunkt liegen. Beim Immortal Time Bias wird ein Zeitraum, in dem der Endpunkt nicht eintreten konnte, als exponierte Zeit klassifiziert, was häufig eine scheinbare Schutzwirkung erzeugt.

Eine robuste Arzneimittelstudie verwendet häufig:

  • Neuanwender (New User) statt Personen, die die Behandlung bereits vertragen haben
  • eine aktive Vergleichsbehandlung mit ähnlicher Indikation
  • dieselbe Definition des Indexdatums in den Gruppen
  • ein zeitabhängiges Expositionsmodell, wenn sich die Exposition ändert
  • einen klaren Umgang mit Therapiewechseln, Therapieabbrüchen und konkurrierenden Ereignissen

Diagnostische Studien

Die diagnostische Genauigkeit ist keine unveränderliche Eigenschaft eines Tests. Sie variiert mit Krankheitsspektrum, Prävalenz, Versorgungsstufe, vorausgegangener Diagnostik und der Durchführung des Tests [3]. QUADAS-2 bewertet Patientenauswahl, Indextest, Referenzstandard sowie Patientenfluss und zeitlichen Ablauf. Die ersten drei Domänen werden zusätzlich hinsichtlich ihrer Anwendbarkeit beurteilt [13].

Patientenauswahl und klinische Rolle

Die Studie sollte möglichst eine konsekutive oder zufällige Serie von Patienten einschließen, bei denen der Test tatsächlich eingesetzt würde. Ein Vergleich zwischen eindeutig kranken Fällen und gesunden Kontrollen führt häufig zu einer überschätzten Genauigkeit. Geben Sie an, ob der Test zum Screening, zur Triage, zur diagnostischen Bestätigung, als Ersatz für einen bestehenden Test oder als Zusatztest eingesetzt werden soll.

Indextest und Referenzstandard

Indextest und Referenzstandard müssen so beschrieben werden, dass sie reproduziert werden können. Der Referenzstandard muss die Zielerkrankung hinreichend korrekt klassifizieren. Kennen die Beurteiler des Referenztests das Ergebnis des Indextests, kann die Übereinstimmung künstlich hoch ausfallen.

Schwellenwerte sollten vorab festgelegt sein. Ein Grenzwert, der nach Analyse aller Ergebnisse gewählt wird, schneidet tendenziell zu optimistisch ab und erfordert eine externe Validierung.

Alle Teilnehmer sollten grundsätzlich innerhalb eines klinisch vertretbaren Zeitintervalls denselben Referenzstandard erhalten. Erhalten nur indextestpositive Patienten eine definitive Diagnostik, entsteht ein partieller Verifikationsbias.

Effektmaße

Maß Definition Klinische Anwendung
Sensitivität Anteil der Erkrankten mit positivem Test Beurteilt falsch-negative Ergebnisse
Spezifität Anteil der Nichterkrankten mit negativem Test Beurteilt falsch-positive Ergebnisse
Positive Likelihood-Ratio Sensitivität dividiert durch 1 minus Spezifität Erhöht die Wahrscheinlichkeit der Erkrankung
Negative Likelihood-Ratio 1 minus Sensitivität dividiert durch Spezifität Verringert die Wahrscheinlichkeit der Erkrankung
Positiver prädiktiver Wert Anteil der Testpositiven, die erkrankt sind Abhängig von Prävalenz und Patientenauswahl
Negativer prädiktiver Wert Anteil der Testnegativen, die nicht erkrankt sind Abhängig von Prävalenz und Patientenauswahl

Sensitivität und Spezifität sollten mit Konfidenzintervallen berichtet werden. Ein einzelner AUC-Wert kann klinisch wichtige Unterschiede bei dem Grenzwert verbergen, der tatsächlich verwendet werden soll. Die entscheidende Frage ist oft, ob das Testergebnis die Wahrscheinlichkeit so stark verändert, dass sich Behandlung, weitere Abklärung oder Nachsorgebedarf ändern.

Systematische Übersichtsarbeiten und Metaanalysen

Eine systematische Übersichtsarbeit ist eine Studie über Studien. Sie kann schwerwiegenden Bias in den Primärstudien nicht ausgleichen. PRISMA unterstützt eine transparente Berichterstattung [4], während AMSTAR 2 ein Bewertungsinstrument für Übersichtsarbeiten zu randomisierten und nicht randomisierten Interventionsstudien ist [14].

Literatursuche und Studienauswahl

Prüfen Sie, ob Fragestellung und Einschlusskriterien vor Suche und Analyse in einem Protokoll festgelegt wurden. Die Suche sollte mehrere relevante Datenbanken, Studienregister, Literaturverzeichnisse und bei Bedarf unveröffentlichte oder regulatorische Quellen umfassen. Vollständige Suchstrategien und das Datum der letzten Suche müssen angegeben werden.

Studienauswahl und Datenextraktion sollten von mindestens zwei Personen durchgeführt oder unabhängig überprüft werden. Eine Liste der nach Volltextprüfung ausgeschlossenen Studien mit Begründungen ermöglicht es, einen selektiven Ausschluss zu erkennen.

Verzerrungsrisiko und Synthese

Die Autoren sollten ein dem Design angepasstes Instrument verwenden und die Bewertung in die Synthese integrieren. Allein einen Summenscore darzustellen ist ungeeignet, da ein einzelner kritischer Mangel wichtiger sein kann als mehrere kleinere Mängel. AMSTAR 2 rät ausdrücklich davon ab, seine 16 Punkte zu einem einzigen Qualitätsscore zu addieren [14].

Eine Metaanalyse ist nur sinnvoll, wenn die Studien hinsichtlich Population, Intervention, Kontrolle, Endpunkt und Zeit ausreichend vergleichbar sind. Ein Random-Effects-Modell löst keine klinische Inkompatibilität. Werden randomisierte und beobachtungsbasierte Ergebnisse kombiniert, können sehr große Beobachtungsstudien dominieren und einen präzisen, aber verzerrten Gesamtschätzer erzeugen.

Heterogenität

Heterogenität ist klinisch und methodisch zu verstehen, nicht allein über I². I² gibt ungefähr an, welcher Anteil der beobachteten Variabilität nicht durch Stichprobenfehler erklärt wird, wird aber von der Präzision der Studien beeinflusst. Ein niedriges I² schließt klinisch relevante Variabilität nicht aus, und ein hohes I² muss keine großen absoluten Unterschiede bedeuten.

Bei einer Random-Effects-Metaanalyse ist das Prädiktionsintervall häufig klinisch aussagekräftiger als das Konfidenzintervall um den mittleren Effekt. Es schätzt, welcher Bereich wahrer Effekte in einem ähnlichen künftigen Setting zu erwarten ist. In einer Analyse statistisch signifikanter Cochrane-Metaanalysen mit Heterogenität schlossen 72,4 Prozent der Prädiktionsintervalle den Nulleffekt ein, und 20,3 Prozent schlossen einen dem Gesamtschätzer entgegengesetzten Effekt ein [15].

Publikationsbias

Kleine positive Studien werden häufig leichter publiziert als kleine negative Studien. Funnel-Plot und Asymmetrietests können den Verdacht auf Small-Study-Effekte stützen, sind bei Heterogenität jedoch schwer zu interpretieren und haben bei wenigen Studien eine geringe Power. Laut AMSTAR 2 sind in der Regel mindestens etwa zehn Studien erforderlich, um eine Funnel-Plot-Asymmetrie sinnvoll zu beurteilen [14]. Ein symmetrischer Funnel-Plot beweist nicht, dass kein Publikationsbias vorliegt.

Interpretation statistischer Ergebnisse

Punktschätzer und Konfidenzintervall

Der Punktschätzer ist die beste Einzelschätzung der Studie. Das Konfidenzintervall beschreibt die statistische Unsicherheit unter den Annahmen des Modells, erfasst aber keinen systematischen Bias. Ein enges Intervall um einen verzerrten Schätzer ergibt kein glaubwürdiges Ergebnis.

Beurteilen Sie, ob das Intervall Folgendes einschließt:

  • keinen Effekt
  • einen klinisch bedeutsamen Nutzen
  • einen klinisch bedeutsamen Schaden
  • sowohl Nutzen als auch Schaden

Ein Ergebnis kann statistisch signifikant, aber klinisch trivial sein. Es kann ebenso nicht signifikant, aber mit einem wichtigen Effekt vereinbar sein, weil das Intervall breit ist.

Relative und absolute Effekte

Angenommen, das Risiko für einen Endpunkt beträgt 20 Prozent in der Kontrollgruppe und 15 Prozent in der Behandlungsgruppe.

  • Risikoverhältnis: 0,15 / 0,20 = 0,75.
  • Relative Risikoreduktion: 1 minus 0,75 = 25 Prozent.
  • Absolute Risikoreduktion: 20 minus 15 Prozentpunkte = 5 Prozentpunkte.
  • Number needed to treat: 1 / 0,05 = 20 über den untersuchten Zeitraum.

Die NNT muss stets auf Population, Vergleich und Zeitraum bezogen werden. Da der absolute Effekt vom Kontrollrisiko abhängt, lässt sich die NNT nicht ohne Weiteres zwischen Studien vergleichen. Die NNT sollte aus einer geeigneten absoluten Risikodifferenz berechnet und mit ihrer Unsicherheit angegeben werden. Bei zeitabhängigen Endpunkten verändert sich die NNT mit dem gewählten Zeitpunkt [16].

Odds Ratio und Hazard Ratio

Die Odds Ratio liegt nahe am Risikoverhältnis, wenn der Endpunkt selten ist, kann aber bei häufigem Endpunkt größer erscheinen. Ist das Kontrollrisiko bekannt, sollte das Ergebnis zusätzlich als absolutes Risiko ausgedrückt werden.

Eine Hazard Ratio vergleicht momentane Ereignisraten während der Nachbeobachtung und ist weder direkt ein Risikoverhältnis noch ein Unterschied in der Überlebenszeit. Ihre Interpretation setzt häufig proportionale Hazards voraus. Bei sich kreuzenden oder spät auseinanderlaufenden Überlebenskurven kann ein einzelner Hazard-Ratio-Wert irreführend sein. Die Restricted Mean Survival Time bis zu einem vorab festgelegten Zeitpunkt kann dann leichter interpretierbar sein [17].

p-Werte und multiple Analysen

Der p-Wert gibt an, wie wenig die Daten mit einem spezifizierten statistischen Modell, häufig der Nullhypothese, vereinbar sind. Er gibt weder die Wahrscheinlichkeit an, dass die Hypothese zutrifft, noch die Größe des Effekts, die klinische Relevanz oder das Verzerrungsrisiko.

Die Grenze 0,05 ist eine Konvention, keine biologische Trennlinie. Die Ergebnisse p = 0,049 und p = 0,051 stellen normalerweise keine qualitativ unterschiedliche Evidenz dar. Interpretieren Sie Effektgröße, Konfidenzintervall, Vorabplanung, Anzahl der Analysen und Validität der Studie.

Werden 20 unabhängige Hypothesen auf dem Signifikanzniveau 0,05 getestet, ist im Mittel ein zufällig positives Ergebnis zu erwarten, wenn alle Nullhypothesen zutreffen. Daher ist eine vorab festgelegte Analysehierarchie oder eine geeignete Kontrolle des Multiplizitätsproblems erforderlich.

Robustheit und Sensitivitätsanalysen

Sensitivitätsanalysen sollten plausible alternative Annahmen prüfen, zum Beispiel:

  • unterschiedliche Annahmen zu fehlenden Daten
  • adjustierte und nicht adjustierte Analysen
  • Ausschluss von Studien mit hohem Verzerrungsrisiko
  • unterschiedliche Modelle für die Heterogenität
  • alternative Definition von Exposition oder Endpunkt
  • Umgang mit konkurrierenden Ereignissen
  • Per-Protocol zusätzlich zu Intention-to-treat, wenn relevant

Ändert sich die Schlussfolgerung bei kleinen, plausiblen Modelländerungen, ist die Evidenz fragil. Der Fragility Index, also die Anzahl der Ereignisse, die geändert werden müssen, damit ein dichotomes signifikantes Ergebnis nicht signifikant wird, kann eine gewisse statistische Instabilität veranschaulichen, ersetzt aber weder Konfidenzintervalle noch die Bewertung des Verzerrungsrisikos. Kritische Übersichtsarbeiten haben gezeigt, dass der Fragility Index in vielen randomisierten Studien sehr niedrig und mitunter kleiner als die Zahl der Teilnehmer mit Loss to Follow-up war [18].

Übertragbarkeit und klinische Relevanz

Die interne Validität muss vor der Generalisierbarkeit beurteilt werden. Ein Ergebnis mit hohem Verzerrungsrisiko wird nicht dadurch brauchbar, dass die Studienpopulation dem Patienten ähnelt. Ist die interne Validität akzeptabel, werden beurteilt:

  • Ähnlichkeit hinsichtlich Alter, Komorbidität, Schweregrad und Vorbehandlung
  • Ausgangsrisiko und absolut zu erwartender Nutzen
  • Versorgungsstufe, Kompetenz und verfügbare Ressourcen
  • Durchführbarkeit der Intervention und Behandlungslast
  • Dauer der Nachbeobachtung
  • Präferenzen und Ziele des Patienten
  • relevante Nebenwirkungen und Wechselwirkungen
  • ob die Kontrollbehandlung der schwedischen Praxis entspricht

Schwedische Empfehlungen, zugelassene Indikationen, Erstattungseinschränkungen und Versorgungsstrukturen können von internationalen Studien abweichen. Eine methodisch gute Studie legt daher nicht allein fest, was im schwedischen Gesundheitswesen getan werden sollte.

Von der Einzelstudie zur Gesamtevidenz

Eine klinische Entscheidung sollte selten auf einer einzigen Studie beruhen. GRADE bewertet die Vertrauenswürdigkeit der Evidenz pro Endpunkt unter anderem anhand von Studiendesign, Verzerrungsrisiko, Inkonsistenz, Indirektheit, Impräzision und Publikationsbias. Die Stärke der Empfehlung wird zusätzlich durch das Verhältnis von Nutzen und Schaden, die Präferenzen der Patienten und weitere Konsequenzen beeinflusst [19].

Domäne Frage bei der abschließenden Bewertung
Verzerrungsrisiko Können die Studienergebnisse systematisch verzerrt sein?
Inkonsistenz Weisen die Studien in dieselbe Richtung, und ist die Variabilität erklärbar?
Indirektheit Entsprechen Population, Intervention, Kontrolle und Endpunkt der klinischen Frage?
Impräzision Schließt das Konfidenzintervall wichtige alternative Schlussfolgerungen aus?
Publikationsbias Könnten negative oder ungünstige Ergebnisse fehlen?
Effektgröße Ist der Effekt groß und klinisch relevant?
Absoluter Effekt Wie viele Ereignisse werden beim Ausgangsrisiko des Patienten beeinflusst?
Nutzen und Schaden Ist die Gesamtbilanz für diesen Patienten günstig?

Praktisches Fazit nach der Bewertung

Schließen Sie die Bewertung mit einem strukturierten Fazit ab, nicht mit einem allgemeinen Urteil wie „gute Studie“ oder „niedrige Evidenz“. Geben Sie an:

  1. Welche Frage die Studie tatsächlich beantwortet.
  2. Die wichtigsten Stärken.
  3. Die wichtigsten Verzerrungsrisiken.
  4. Punktschätzer, Konfidenzintervall und absoluten Effekt.
  5. Ob die Ergebnisse robust und vorab festgelegt sind.
  6. Für welche Patienten und Versorgungssettings die Ergebnisse gelten.
  7. Wie sich die Studie zur übrigen Evidenz verhält.
  8. Was das Ergebnis vernünftigerweise für die klinische Praxis bedeutet.
  9. Welche Unsicherheit bestehen bleibt.

Kritische Bewertung ist keine Jagd nach Fehlern, die eine Studie automatisch disqualifizieren. Ziel ist es zu entscheiden, wie viel Gewicht das Ergebnis verdient. Eine kleine, aber sorgfältig durchgeführte Studie kann wertvolle, wenn auch unsichere Informationen liefern. Eine sehr große Studie kann eine hohe Präzision bieten und dennoch unbrauchbar sein, wenn die Vergleichsgruppen auf systematisch verzerrte Weise gebildet wurden. Die klinisch relevante Schlussfolgerung ergibt sich aus der Kombination von Validität, Effektgröße, Präzision, Übertragbarkeit und Übereinstimmung mit der Gesamtevidenz.

Quellen

  1. Hopewell S et al. CONSORT 2025 explanation and elaboration: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228832
  2. Vandenbroucke JP et al. Strengthening the Reporting of Observational Studies in Epidemiology (STROBE): explanation and elaboration. PLoS Medicine 2007. PMID: 17941715
  3. Cohen JF et al. STARD 2015 guidelines for reporting diagnostic accuracy studies: explanation and elaboration. BMJ Open 2016. PMID: 28137831
  4. Page MJ et al. PRISMA 2020 explanation and elaboration: updated guidance and exemplars for reporting systematic reviews. BMJ 2021. PMID: 33781993
  5. Hoffmann TC et al. Better reporting of interventions: template for intervention description and replication (TIDieR) checklist and guide. BMJ 2014. PMID: 24609605
  6. Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
  7. Medcalf E et al. Addressing missing outcome data in randomised controlled trials: A methodological scoping review. Contemporary Clinical Trials 2024. PMID: 38857674
  8. Liu P et al. Age-treatment subgroup analyses in Cochrane intervention reviews: a meta-epidemiological study. BMC Medicine 2019. PMID: 31639007
  9. Junqueira DR et al. CONSORT Harms 2022 statement, explanation, and elaboration: updated guideline for the reporting of harms in randomized trials. Journal of Clinical Epidemiology 2023. PMID: 37100738
  10. Yuniar CT et al. Adverse Events Reporting Quality of Randomized Controlled Trials of COVID-19 Vaccine Using the CONSORT Criteria for Reporting Harms: A Systematic Review. Vaccines 2022. PMID: 35214773
  11. Prada-Ramallal G et al. Bias in pharmacoepidemiologic studies using secondary health care databases: a scoping review. BMC Medical Research Methodology 2019. PMID: 30871502
  12. Forbes SP, Dahabreh IJ. Benchmarking Observational Analyses Against Randomized Trials: a Review of Studies Assessing Propensity Score Methods. Journal of General Internal Medicine 2020. PMID: 32193818
  13. Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
  14. Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
  15. IntHout J et al. Plea for routinely presenting prediction intervals in meta-analysis. BMJ Open 2016. PMID: 27406637
  16. Okwuokenye M et al. Number Needed to Treat in Multiple Sclerosis Clinical Trials. Neurology and Therapy 2017. PMID: 28176189
  17. Jiménez JL. Quantifying treatment differences in confirmatory trials under non-proportional hazards. Journal of Applied Statistics 2022. PMID: 35707213
  18. Mielke D, Rohde V. Randomized controlled trials, a critical re-appraisal. Neurosurgical Review 2021. PMID: 33025186
  19. Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583

Aktualisiert 29. September 2026