Evidenzbasierte Medizin: systematische Übersichtsarbeiten und Metaanalysen

Zusammenfassung

Eine systematische Übersichtsarbeit verwendet vorab festgelegte, transparente und reproduzierbare Methoden, um Forschungsergebnisse zu einer klar umrissenen Frage zu identifizieren, auszuwählen, zu bewerten und zusammenzufassen. Eine Metaanalyse ist die statistische Zusammenfassung der Ergebnisse aus mindestens zwei Studien. Die Begriffe sind daher nicht synonym. Eine systematische Übersichtsarbeit kann ohne Metaanalyse auskommen, und eine statistische Zusammenfassung ist nicht automatisch systematisch.

Für die klinische Anwendung sollte eine Übersichtsarbeit in folgender Reihenfolge beurteilt werden: Ist die Frage für den aktuellen Patienten relevant? Ist die Literaturrecherche ausreichend breit und aktuell? Wurden Studien zuverlässig ausgewählt und Daten zuverlässig extrahiert? Wurde das Verzerrungsrisiko der Primärstudien beurteilt? Sind die Studien ausreichend ähnlich, um gepoolt zu werden? Wie groß sind die relativen und absoluten Effekte? Wie präzise ist die Schätzung? Gibt es klinisch bedeutsame Heterogenität, Small-Study-Effekte oder selektives Berichten? Schließlich ist die Vertrauenswürdigkeit der Evidenz für jeden wichtigen Endpunkt zu bewerten.

PRISMA 2020 ist ein Berichtsstandard mit 27 Hauptpunkten. Er macht die Berichterstattung transparenter, ist jedoch kein Instrument zur Beurteilung der methodischen Qualität [1,2]. Zur kritischen Bewertung von Interventionsübersichten kann AMSTAR 2 eingesetzt werden, während ROBIS auf das Verzerrungsrisiko der Übersichtsarbeit selbst ausgerichtet ist [3,4]. Die Vertrauenswürdigkeit der Evidenz sollte nicht mit statistischer Signifikanz gleichgesetzt werden. GRADE unterscheidet zwischen hoher, moderater, niedriger und sehr niedriger Vertrauenswürdigkeit und berücksichtigt Verzerrungsrisiko, Inkonsistenz, Indirektheit, unzureichende Präzision und Publikationsbias [5,6].

Eine klinische Empfehlung ergibt sich nicht unmittelbar aus einer Metaanalyse. Die Entscheidung muss außerdem den absoluten Nutzen, unerwünschte Wirkungen, die Wertvorstellungen des Patienten, die Umsetzbarkeit, die Kosten und die Übertragbarkeit der Studienpopulation auf den aktuellen Patienten berücksichtigen.

Grundbegriffe

Systematische Übersichtsarbeit

Eine systematische Übersichtsarbeit fasst Forschungsergebnisse zu einer klar formulierten Frage mit expliziten Methoden zusammen. Zentrale Komponenten sind:

  1. Eine vorab festgelegte Fragestellung und Einschlusskriterien.
  2. Ein Protokoll, das festgelegt wird, bevor die Ergebnisse bekannt sind.
  3. Eine breite und reproduzierbare Literaturrecherche.
  4. Eine systematische Studienauswahl.
  5. Eine strukturierte Datenextraktion.
  6. Die Beurteilung des Verzerrungsrisikos der eingeschlossenen Studien.
  7. Eine geplante qualitative oder statistische Synthese.
  8. Die Beurteilung der Vertrauenswürdigkeit der Evidenz.
  9. Eine transparente Darstellung von Methoden, Abweichungen und Ergebnissen.

PRISMA 2020 definiert eine systematische Übersichtsarbeit anhand der expliziten und systematischen Methoden, nicht danach, ob eine statistische Zusammenfassung durchgeführt wurde [1]. Dass eine Publikation als systematische Übersichtsarbeit bezeichnet wird, ist daher für sich genommen kein Qualitätsnachweis.

Metaanalyse

Eine Metaanalyse kombiniert Effektmaße und deren Unsicherheit aus mindestens zwei Studien zu einer gepoolten Schätzung. Studien mit höherer statistischer Präzision erhalten in der Regel ein größeres Gewicht. Die Metaanalyse kann die Präzision erhöhen, die Variation zwischen Studien sichtbar machen und die Analyse von Effektmodifikatoren ermöglichen.

Zugleich kann eine Metaanalyse eine trügerische Präzision vermitteln, wenn sie Studien kombiniert, die sich hinsichtlich Population, Intervention, Vergleich, Endpunkt, Nachbeobachtung oder Verzerrungsrisiko wesentlich unterscheiden. Eine präzise gepoolte Schätzung kann systematisch falsch sein, wenn die eingeschlossenen Studien systematisch verzerrt sind.

Verwandte Formen von Übersichtsarbeiten

Art der Übersichtsarbeit Hauptzweck Wichtige Einschränkung
Systematische Übersichtsarbeit Beantwortung einer umrissenen Frage mit systematischen Methoden Die Qualität hängt von Recherche, Auswahl, Primärstudien und Synthese ab
Systematische Übersichtsarbeit mit paarweiser Metaanalyse Zusammenfassung zweier Alternativen, etwa Behandlung gegen Placebo Erfordert ausreichende klinische und methodische Vergleichbarkeit
Netzwerk-Metaanalyse Vergleich mehrerer Behandlungen mit direkter und indirekter Evidenz Erfordert Transitivität und eine plausible Übereinstimmung zwischen direkter und indirekter Evidenz
Metaanalyse individueller Patientendaten Analyse der Daten jedes einzelnen Teilnehmers Ressourcenintensiv und anfällig dafür, welche Studiengruppen Daten bereitstellen
Living Systematic Review Fortlaufende Aktualisierung, sobald neue Evidenz publiziert wird Erfordert langfristige Organisation, Aktualisierungsregeln und Versionskontrolle
Rapid Review Beantwortung einer Frage in kurzer Zeit mit vereinfachten Methoden Abkürzungen können das Risiko erhöhen, relevante Studien zu übersehen
Scoping Review Erfassung von Umfang, Konzepten und Wissenslücken Ist in der Regel nicht darauf ausgelegt, eine belastbare Effektschätzung zu liefern
Übersicht über Übersichtsarbeiten Zusammenfassung mehrerer systematischer Übersichtsarbeiten Überlappende Primärstudien können mehrfach gezählt werden

Von der klinischen Frage zum Protokoll

Die Frage vor der Recherche formulieren

Für Interventionsfragen wird in der Regel das PICO-Schema verwendet:

  • P, Population oder klinische Erkrankung
  • I, Intervention
  • C, Vergleich (Comparison)
  • O, Endpunkt (Outcome)

Die Frage sollte außerdem Studiendesign, Versorgungskontext und relevante Nachbeobachtungsdauer präzisieren. Eine Frage nach der Wirkung eines Arzneimittels bei Erwachsenen mit einer bestimmten Diagnose ist unzureichend eingegrenzt, wenn Dosis, Vergleichsbehandlung, Schweregrad der Erkrankung und Zeitpunkt der Endpunkterhebung für die Interpretation entscheidend sind.

Endpunkte sollten nach Patientenrelevanz priorisiert werden. Mortalität, Symptome, Funktionsfähigkeit, Lebensqualität und schwerwiegende unerwünschte Wirkungen sind oft wichtiger als Laborparameter oder andere Surrogatendpunkte. Ein statistisch sensitiver Surrogatendpunkt kann ein eindrucksvolleres Ergebnis liefern als ein patientenrelevanter Endpunkt, ohne zu zeigen, dass der Patient länger lebt oder sich besser fühlt.

Bei diagnostischen Fragen müssen Zielpopulation, Indextest, Referenzstandard, Schwellenwert und vorgesehene klinische Rolle festgelegt werden, etwa Triage, Zusatztest oder Ersatztest. Prognostische Fragen erfordern unter anderem einen klar definierten Ausgangszeitpunkt, einen prognostischen Faktor, einen Endpunkt und einen Zeithorizont.

Protokoll und Registrierung

Das Protokoll sollte Folgendes angeben:

  • Fragestellung und Einschlusskriterien
  • Informationsquellen und übergeordnete Suchstrategie
  • primäre und sekundäre Endpunkte
  • wie mehrere Messzeitpunkte und Messskalen priorisiert werden
  • Vorgehen bei Studienauswahl und Datenextraktion
  • Instrumente zur Beurteilung des Verzerrungsrisikos
  • geplante Effektmaße und metaanalytische Modelle
  • Umgang mit fehlenden Daten und Studien ohne Ereignisse
  • geplante Subgruppen-, Sensitivitäts- und Metaregressionsanalysen
  • Methode zur Beurteilung der Vertrauenswürdigkeit der Evidenz

Eine prospektive Registrierung, beispielsweise in PROSPERO, schafft eine datierte Dokumentation der geplanten Methoden und kann nachträgliche Änderungen sichtbar machen. Die Registrierung kann zudem ungeplante Duplikationen von Übersichtsarbeiten verringern [7]. Eine Registrierung bedeutet jedoch nicht, dass das Protokoll eine vollständige methodische Begutachtung durchlaufen hat.

Legitime Protokolländerungen können notwendig sein. Sie müssen datiert, begründet und offengelegt werden. Änderungen, nachdem die Forschenden die Ergebnisse gesehen haben, sind besonders heikel, etwa ein Wechsel des primären Endpunkts, eine geänderte Nachbeobachtungsdauer oder neue Subgruppen.

flowchart TD
A["Klinische Frage und<br>patientenrelevante Endpunkte eingrenzen"] --> B["Protokoll<br>und Analyseplan verfassen"]
B --> C["Protokoll vor der<br>Studienauswahl registrieren"]
C --> D["Breite, reproduzierbare<br>Recherche durchführen"]
D --> E["Studien auswählen und Daten extrahieren<br>mit unabhängiger Kontrolle"]
E --> F["Verzerrungsrisiko<br>für jeden wichtigen Endpunkt beurteilen"]
F --> G["Klinische und methodische<br>Vergleichbarkeit beurteilen"]
G -->|"Ausreichend"| H["Geplante statistische<br>Synthese durchführen"]
G -->|"Unzureichend"| I["Strukturierte Synthese<br>ohne Metaanalyse"]
H --> J["Heterogenität, Präzision<br>und Berichtsbias beurteilen"]
I --> J
J --> K["Vertrauenswürdigkeit<br>der Evidenz graduieren"]
K --> L["Absolute Effekte und klinische<br>Anwendbarkeit interpretieren"]

Literaturrecherche und Studienauswahl

Informationsquellen

Keine einzelne Datenbank enthält die gesamte relevante medizinische Forschung. Eine Recherche muss daher möglicherweise Folgendes umfassen:

  • MEDLINE oder PubMed
  • Embase
  • Cochrane Central Register of Controlled Trials
  • fachspezifische Datenbanken
  • regionale Datenbanken
  • ClinicalTrials.gov und das Studienregister der WHO
  • regulatorische Dokumente
  • Dissertationen und Kongressabstracts
  • Literaturverzeichnisse und Zitationssuche
  • Kontakte zu Forschenden oder Herstellern

PRISMA-S umfasst 16 Punkte zur reproduzierbaren Berichterstattung über Literaturrecherchen. Datenbank, Suchoberfläche, Datum, vollständiger Suchstring, Filter, Einschränkungen und ergänzende Suchmethoden sollten angegeben werden [8]. Eine Suche in MEDLINE über Ovid ist technisch nicht identisch mit einer Suche in MEDLINE über eine andere Plattform.

Die Suchstrategie sollte Schlagwörter (Indexterme) und Freitextbegriffe kombinieren. Unnötige Einschränkungen nach Sprache, Datum oder Publikationsart können relevante Evidenz ausschließen. Werden Einschränkungen verwendet, sind sie anhand der Fragestellung zu begründen, nicht allein aus Bequemlichkeit.

Ein Informationsspezialist kann dazu beitragen, sowohl Sensitivität als auch Reproduzierbarkeit zu verbessern. PRESS ist eine eigene Leitlinie für das kollegiale Peer Review elektronischer Suchstrategien [9].

Publizierte und unpublizierte Evidenz

Zeitschriftenartikel allein ergeben nicht immer ein vollständiges Bild. Studien mit statistisch signifikanten oder kommerziell günstigen Ergebnissen werden möglicherweise mit größerer Wahrscheinlichkeit publiziert. Ihre Ergebnisse werden unter Umständen auch vollständiger berichtet als negative oder nicht eindeutige Ergebnisse.

Studienregister, regulatorische Dokumente und Kontakt mit Prüfärzten können Folgendes aufdecken:

  • abgeschlossene, aber unpublizierte Studien
  • vorab registrierte primäre Endpunkte
  • Endpunkte, die im Zeitschriftenartikel weggelassen wurden
  • längere Nachbeobachtung
  • zusätzliche unerwünschte Wirkungen
  • mehrere Publikationen aus derselben Studie

Ein häufiger Fehler besteht darin, mehrere Publikationen aus derselben Studie als separate Studien zu zählen. Protokoll, Hauptpublikation, Sekundäranalyse und Langzeitnachbeobachtung müssen einer gemeinsamen Studien-ID zugeordnet werden.

Studienauswahl und Datenextraktion

Die Auswahl erfolgt in der Regel in zwei Schritten:

  1. Screening von Titel und Abstract.
  2. Volltextprüfung potenziell relevanter Berichte.

Mindestens zwei Personen sollten die Volltexte unabhängig voneinander beurteilen. Ein ähnliches Doppelverfahren, oder eine Extraktion mit anschließender sorgfältiger unabhängiger Kontrolle, sollte für zentrale Daten angewendet werden. Die Gründe für einen Ausschluss auf Volltextebene sind zu dokumentieren.

Die Datenextraktion muss mehr umfassen als Teilnehmerzahl und Effektmaß. Wichtige Variablen sind unter anderem:

  • Rekrutierungsumfeld und Zeitraum
  • Ein- und Ausschlusskriterien
  • Schweregrad der Erkrankung und Komorbidität
  • Dosis der Intervention und Behandlungsdauer
  • Vergleichsbehandlung
  • Adhärenz und Behandlungswechsel
  • Definition und Messmethode jedes Endpunkts
  • Nachbeobachtungsdauer
  • Drop-outs und Analyseprinzip
  • Finanzierung und Interessenkonflikte
  • Angaben, die zur Beurteilung des Verzerrungsrisikos erforderlich sind

Beurteilung des Verzerrungsrisikos

Verzerrungsrisiko ist nicht dasselbe wie Berichtsqualität

Eine gut geschriebene Studie kann ein hohes Verzerrungsrisiko aufweisen, und eine unzureichend berichtete Studie kann in mancher Hinsicht korrekt durchgeführt worden sein. Fehlen jedoch notwendige Informationen, ist eine sichere Beurteilung oft nicht möglich.

Für randomisierte Studien bewertet RoB 2 fünf Hauptdomänen: den Randomisierungsprozess, Abweichungen von der vorgesehenen Intervention, fehlende Endpunktdaten, die Messung der Endpunkte und die Auswahl des berichteten Ergebnisses [10]. Die Beurteilung erfolgt endpunktspezifisch. Eine unverblindete Studie kann beispielsweise für die Gesamtmortalität ein geringeres Verzerrungsrisiko haben als für selbstberichtete Schmerzen.

Für Studien zur diagnostischen Genauigkeit umfasst QUADAS-2 Patientenauswahl, Indextest, Referenzstandard sowie Fluss und Zeitablauf. Die ersten drei Domänen werden zusätzlich hinsichtlich der Anwendbarkeit beurteilt [11]. Bei nicht randomisierten Interventionsstudien ist besondere Aufmerksamkeit auf Confounding, Selektion und die Klassifikation der Interventionen zu richten.

Instrumente auf verschiedenen Ebenen

Gegenstand der Beurteilung Geeignetes Instrument Welche Frage das Instrument beantwortet
Randomisierte Studie RoB 2 Kann die Schätzung der Studie systematisch verzerrt sein?
Diagnostische Studie QUADAS-2 Besteht ein Verzerrungsrisiko oder ein Problem mit der Anwendbarkeit?
Systematische Interventionsübersicht AMSTAR 2 Wurde die Übersichtsarbeit mit methodisch verlässlichen Verfahren durchgeführt?
Systematische Übersichtsarbeit ROBIS Besteht ein Verzerrungsrisiko in Prozess, Ergebnissen oder Schlussfolgerungen der Übersichtsarbeit?
Gesamte Evidenzbasis für einen Endpunkt GRADE Wie groß sollte unser Vertrauen in die Effektschätzung sein?
Berichterstattung über eine systematische Übersichtsarbeit PRISMA 2020 Wurden Methoden und Ergebnisse vollständig und transparent dargestellt?

AMSTAR 2 umfasst 16 Punkte und ist für Interventionsübersichten mit randomisierten oder nicht randomisierten Studien vorgesehen. Das Instrument betont sieben kritische Domänen: Protokoll, Literaturrecherche, Begründung der Ausschlüsse, Verzerrungsrisiko der Primärstudien, statistische Methoden, Berücksichtigung von Bias bei der Interpretation sowie Publikationsbias. Die Punkte sollen nicht zu einem einfachen numerischen Qualitätsscore addiert werden [3].

ROBIS bewertet vier Domänen des Übersichtsprozesses: Einschlusskriterien, Identifikation und Auswahl der Studien, Datenerhebung und Studienbewertung sowie Synthese und Ergebnisse. Anschließend erfolgt eine Gesamtbeurteilung des Verzerrungsrisikos in den Schlussfolgerungen der Übersichtsarbeit [4].

Statistische Synthese

Das Effektmaß nach Endpunkt und Fragestellung wählen

Gängige Effektmaße sind:

Art des Endpunkts Effektmaß Klinische Interpretation
Dichotomer Endpunkt Relatives Risiko, RR Risiko in der Interventionsgruppe geteilt durch das Risiko in der Kontrollgruppe
Dichotomer Endpunkt Odds Ratio, OR Verhältnis der Odds, kann bei häufigem Endpunkt fälschlich als RR interpretiert werden
Dichotomer Endpunkt Risikodifferenz, RD Absoluter Unterschied im Risiko
Zeit bis zum Ereignis Hazard Ratio, HR Relative momentane Ereignisrate während der Nachbeobachtung
Stetiger Endpunkt, gleiche Skala Mittelwertdifferenz, MD Unterschied in der ursprünglichen Einheit der Skala
Stetiger Endpunkt, verschiedene Skalen Standardisierte Mittelwertdifferenz, SMD Unterschied ausgedrückt in Standardabweichungen
Diagnostischer Endpunkt Sensitivität und Spezifität Fähigkeit des Tests, Kranke bzw. Nichtkranke zu erkennen

Relative Effektmaße müssen durch absolute Effekte ergänzt werden. Beträgt das RR 0,75, liegt die absolute Risikoreduktion bei einem Basisrisiko von 10 Prozent bei 2,5 Prozentpunkten, bei einem Basisrisiko von 1 Prozent jedoch nur bei 0,25 Prozentpunkten. Derselbe relative Effekt kann daher eine völlig unterschiedliche klinische Bedeutung haben.

Die Number needed to treat, NNT, lässt sich als Kehrwert der absoluten Risikoreduktion berechnen, wenn Zeitraum, Population und Vergleich klar angegeben sind. Die NNT ist keine unveränderliche Eigenschaft der Behandlung. Sie variiert mit Basisrisiko, Nachbeobachtungsdauer und Effektmaß.

Fixed effect und random effects

Ein Fixed-Effect-Modell nimmt an, dass die Studien denselben gemeinsamen wahren Effekt schätzen und dass beobachtete Unterschiede überwiegend auf zufälliger Unsicherheit beruhen. Ein Random-Effects-Modell nimmt an, dass die wahren Effekte zwischen den Studien variieren, und schätzt den Mittelwert einer Verteilung von Effekten.

Die Wahl darf nicht allein dadurch getroffen werden, dass zuerst auf Heterogenität getestet wird. Klinisches Wissen über Populationen, Behandlungen und Kontexte soll die Modellwahl leiten. Ein Random-Effects-Modell löst das Problem einer unangemessenen Zusammenfassung nicht. Das Modell kann zudem kleinen Studien ein relativ größeres Gewicht geben, was problematisch ist, wenn kleine Studien selektiver publiziert werden oder ein höheres Verzerrungsrisiko aufweisen.

Bei wenigen Studien wird die Schätzung der Variation zwischen den Studien unsicher. Das Konfidenzintervall um den gepoolten Effekt kann dann bei manchen Standardmethoden zu eng ausfallen. Methodenwahl und Sensitivitätsanalysen sollten daher klar offengelegt werden.

Heterogenität

Heterogenität kann sein:

  • klinisch, etwa unterschiedlicher Schweregrad der Erkrankung, unterschiedliches Alter oder unterschiedliche Intervention
  • methodisch, etwa unterschiedliches Design, Verzerrungsrisiko oder unterschiedliche Messmethode
  • statistisch, das beobachtete Muster variierender Effektschätzungen

I² schätzt, welcher Anteil der beobachteten Variation eher mit Variation zwischen den Studien als allein mit Stichprobenunsicherheit vereinbar ist [12]. Häufig wird folgender ungefährer Interpretationsrahmen verwendet:

I² Mögliche Interpretation
0 bis 40 Prozent Möglicherweise unbedeutend
30 bis 60 Prozent Möglicherweise moderat
50 bis 90 Prozent Möglicherweise substanziell
75 bis 100 Prozent Möglicherweise erheblich

Die Bereiche überlappen absichtlich. I² darf nicht mechanisch interpretiert werden. Ein hohes I² kann entstehen, wenn große, präzise Studien kleine, aber konsistente Unterschiede zeigen. Ein niedriges I² kann auftreten, wenn wenige kleine Studien zu unpräzise sind, um eine tatsächliche Variation aufzudecken.

Tau² beschreibt die Varianz zwischen den wahren Studieneffekten, liegt jedoch auf einer Skala, die klinisch schwer zu interpretieren sein kann. Ein Prädiktionsintervall zeigt dagegen, in welchem Bereich der wahre Effekt in einer neuen vergleichbaren Studie zu erwarten ist. In einer Methodenstudie signifikanter Random-Effects-Metaanalysen mit Heterogenität schlossen 72,4 Prozent der Prädiktionsintervalle den Nulleffekt ein, obwohl das Konfidenzintervall für den mittleren Effekt dies nicht tat [13]. Prädiktionsintervalle sind besonders wertvoll, wenn das Ergebnis auf ein neues Versorgungssetting übertragen werden soll, werden jedoch unsicher, wenn nur wenige Studien eingeschlossen sind.

Subgruppenanalysen und Metaregression

Subgruppenanalysen sollten wenige sein, klinisch begründet und möglichst vorab festgelegt. Es ist falsch, auf einen unterschiedlichen Behandlungseffekt zwischen zwei Gruppen zu schließen, nur weil das Ergebnis in der einen Gruppe statistisch signifikant ist, in der anderen jedoch nicht. Der Unterschied zwischen den Gruppen muss mit einem Interaktionstest analysiert werden.

Die Glaubwürdigkeit steigt, wenn:

  • die Hypothese im Protokoll festgelegt wurde
  • biologische oder klinische Plausibilität besteht
  • der Unterschied groß ist
  • er zwischen den Studien konsistent ist
  • der Interaktionstest eine Effektmodifikation stützt
  • die Analyse auf Unterschieden zwischen Teilnehmern innerhalb von Studien beruht und nicht allein auf Mittelwertunterschieden zwischen Studien

Die Metaregression ist eine Beobachtungsanalyse auf Studienebene. Sie kann Hypothesen generieren, ist jedoch anfällig bei wenigen Studien, multiplem Testen, Confounding und ökologischen Fehlschlüssen.

Sensitivitätsanalysen

Die Robustheit sollte durch Analysen geprüft werden, die beispielsweise:

  • Studien mit hohem Verzerrungsrisiko ausschließen
  • alternative statistische Modelle verwenden
  • alternative Annahmen zu fehlenden Daten verwenden
  • adjustierte und nicht adjustierte Beobachtungsdaten trennen
  • unpublizierte oder nur als Abstract berichtete Studien ausschließen
  • Cluster-, Crossover- und mehrarmige Studien auf alternative Weise behandeln
  • den Einfluss einzelner einflussreicher Studien prüfen

Ändert sich die Hauptschlussfolgerung deutlich, sollte dies klar erkennbar sein und in die Evidenzgraduierung einfließen.

Berichtsbias und Small-Study-Effekte

Ein Funnel Plot stellt die Effektschätzungen der Studien gegen ein Maß für Präzision oder Standardfehler dar. Ohne Selektion und andere Small-Study-Effekte ist ein annähernd symmetrischer Trichter zu erwarten. Eine Asymmetrie kann verursacht werden durch:

  • selektive Publikation
  • selektives Berichten von Endpunkten
  • geringere methodische Qualität kleiner Studien
  • tatsächliche klinische Unterschiede zwischen kleinen und großen Studien
  • Zufall
  • ein ungeeignetes Effektmaß oder eine ungeeignete statistische Methode

Funnel Plot und regressionsbasierte Tests haben eine geringe Power, wenn nur wenige Studien eingeschlossen sind. Eine gängige praktische Grenze besagt, dass solche Analysen bei weniger als zehn Studien selten sinnvoll sind [3,14]. Ein nicht signifikanter Test schließt Publikationsbias nicht aus.

Methoden wie Trim and Fill können als explorative Sensitivitätsanalysen eingesetzt werden, können jedoch weder beweisen, wie viele Studien fehlen, noch den wahren Effekt wiederherstellen. Die Beurteilung sollte auch Studienregister, Protokolle, Finanzierung, das Vorkommen kleiner positiver Studien und Unterschiede zwischen registrierten und publizierten Endpunkten berücksichtigen.

Synthese ohne Metaanalyse

Auf eine Metaanalyse sollte verzichtet werden, wenn die Studien zu unterschiedlich sind oder die Daten nicht in vergleichbarer Form ausgedrückt werden können. Das Fehlen einer Metaanalyse rechtfertigt jedoch keine unsystematische narrative Zusammenfassung.

SWiM nennt neun Berichtsbereiche für die Synthese ohne Metaanalyse. Diese umfassen die Gruppierung der Studien, standardisierte Effektmaße, die gewählte Synthesemethode, die Priorisierung der Ergebnisse, den Umgang mit Heterogenität, die Vertrauenswürdigkeit der Evidenz, die Darstellung in Tabellen und Abbildungen, die Zusammenfassung der Ergebnisse sowie die Limitationen der Synthese [15].

Eine strukturierte Synthese sollte:

  • Studien nach klinisch relevanten Vergleichen gruppieren
  • angeben, welche Studien zu jeder Schlussfolgerung beitragen
  • Richtung, Größe und Präzision darstellen, nicht nur P-Werte
  • das Verzerrungsrisiko berücksichtigen
  • vermeiden, kleinen und großen Studien dieselbe Bedeutung beizumessen
  • widersprüchliche Ergebnisse darstellen
  • erklären, warum keine Metaanalyse durchgeführt wurde

Ein Vote Counting anhand der Zahl statistisch signifikanter Studien sollte vermieden werden. Dabei können eine kleine und eine große Studie gleich gezählt werden, während zugleich statistische Signifikanz mit der Effektgröße verwechselt wird.

Netzwerk-Metaanalyse

Eine Netzwerk-Metaanalyse kann mehrere Interventionen in einem zusammenhängenden Netzwerk vergleichen. Vergleichen Studien A mit B und B mit C, lässt sich ein indirekter Vergleich zwischen A und C berechnen. Die Methode kann die indirekte Schätzung zudem mit direkt vergleichenden Studien kombinieren.

Über die üblichen metaanalytischen Anforderungen hinaus sind erforderlich:

  • Transitivität, Studien in verschiedenen Vergleichen müssen hinsichtlich der Effektmodifikatoren ausreichend ähnlich sein
  • Konsistenz, direkte und indirekte Evidenz müssen miteinander vereinbar sein
  • ein verbundenes Evidenznetzwerk
  • ein angemessener Umgang mit Studien mit mehreren Behandlungsarmen
  • eine klare Darstellung der Unsicherheit jedes Vergleichs

Die Netzwerk-Erweiterung von PRISMA umfasst besondere Anforderungen unter anderem an Netzwerkgeometrie, indirekte Vergleiche und die Beurteilung von Inkonsistenz [16]. Behandlungsrankings sind vorsichtig zu interpretieren. Ein hoher Rang kann auf wenigen Studien, indirekten Vergleichen oder einer niedrigen Vertrauenswürdigkeit der Evidenz beruhen.

Eine große Netzwerk-Metaanalyse zu Antidepressiva veranschaulicht sowohl die Möglichkeiten als auch die Grenzen. Die Analyse umfasste 522 Studien und 116 477 Teilnehmende, doch bei 73 Prozent der Studien wurde ein moderates Verzerrungsrisiko festgestellt, und die Vertrauenswürdigkeit der Evidenz reichte von moderat bis sehr niedrig [17]. Ein umfangreiches Netzwerk und schmale Intervalle machen also nicht alle Vergleiche gleich verlässlich.

Unerwünschte Wirkungen

Systematische Übersichtsarbeiten sind häufig besser auf den Nutzen als auf Schäden ausgelegt. Randomisierte Studien können zu klein oder zu kurz sein, um seltene, verzögerte oder kumulative unerwünschte Wirkungen zu erkennen. Beobachtungsstudien und Registerdaten können daher als Ergänzung erforderlich sein, auch wenn sie ein größeres Risiko für Confounding und andere systematische Fehler mit sich bringen.

Für jeden Schadensendpunkt sollte die Übersichtsarbeit darlegen:

  • wie die unerwünschte Wirkung definiert wurde
  • ob sie aktiv erfragt oder spontan berichtet wurde
  • den Überwachungszeitraum
  • die Zahl der Teilnehmenden mit dem Ereignis und die Zahl der Analysierten
  • den Umgang mit Studien ohne Ereignisse
  • Schweregrad und Therapieabbrüche
  • mögliche Kausalität
  • Drop-outs und selektives Berichten

PRISMA Harms wurde entwickelt, weil eine mangelhafte Berichterstattung in Primärstudien häufig verstärkt wird, wenn unerwünschte Wirkungen in Übersichtsarbeiten zusammengefasst werden [18]. Die Formulierung, es seien keine schwerwiegenden unerwünschten Wirkungen berichtet worden, bedeutet nicht zwangsläufig, dass aktiv danach gesucht wurde oder dass sie nicht auftraten.

Beurteilung der Vertrauenswürdigkeit der Evidenz

GRADE bewertet die gesamte Evidenzbasis für jeden Endpunkt, nicht eine Studie oder Publikation als Ganzes. Es werden vier Stufen verwendet [5]:

Stufe Praktische Bedeutung
Hoch Großes Vertrauen, dass der wahre Effekt nahe an der Schätzung liegt
Moderat Der wahre Effekt liegt wahrscheinlich nahe an der Schätzung, kann aber deutlich abweichen
Niedrig Begrenztes Vertrauen, der wahre Effekt kann deutlich abweichen
Sehr niedrig Sehr geringes Vertrauen in die Effektschätzung

Randomisierte Studien beginnen normalerweise mit hoher Vertrauenswürdigkeit und können abgestuft werden wegen:

  1. Verzerrungsrisiko.
  2. Inkonsistenz.
  3. Indirektheit.
  4. Unzureichender Präzision.
  5. Publikationsbias.

Beobachtungsstudien beginnen normalerweise auf niedriger Stufe, können in bestimmten Situationen jedoch aufgestuft werden, etwa bei sehr großem Effekt, bei einer Dosis-Wirkungs-Beziehung oder wenn plausibles verbleibendes Confounding den beobachteten Effekt wahrscheinlich verringern würde [5].

GRADE unterscheidet die Vertrauenswürdigkeit der Evidenz von der Stärke der Empfehlung. Eine Empfehlung erfordert zusätzlich eine Bewertung des Verhältnisses von Nutzen und Schaden, der Patientenpräferenzen, des Ressourcenverbrauchs, der Gerechtigkeit, der Akzeptanz und der Umsetzbarkeit [6].

Eine Summary-of-Findings-Tabelle sollte angeben:

  • Endpunkt und Nachbeobachtungsdauer
  • Anzahl der Studien und Teilnehmenden
  • Risiko ohne Intervention
  • Risiko mit Intervention
  • relativen Effekt
  • absoluten Effekt
  • Vertrauenswürdigkeit der Evidenz
  • Gründe für Ab- oder Aufstufung

Absolute Effekte sind zentral. In einer Metaanalyse zum PSA-Screening entsprach eine mögliche relative Senkung der prostatakarzinomspezifischen Mortalität nur etwa einem Todesfall weniger pro 1 000 gescreenten Männern über zehn Jahre, während das Screening gleichzeitig zu zusätzlicher Diagnostik und behandlungsbedingten Komplikationen führte [19]. Der relative Effekt allein hätte ein unvollständiges Bild vermittelt.

Kritische Bewertung bei klinischer Anwendung

Eine praktische Prüfreihenfolge

Frage Zeichen, die das Vertrauen stärken Warnsignale
Ist die Übersichtsarbeit relevant? PICO und Nachbeobachtung entsprechen der klinischen Frage Breite oder abweichende Population, Surrogatendpunkte
Ist sie aktuell? Kürzlich abgeschlossene Recherche oder laufende Living-Aktualisierung Sich rasch entwickelndes Forschungsfeld und mehrere Jahre alte Recherche
Gab es ein Protokoll? Prospektives Protokoll und erläuterte Änderungen Registrierung nach der Datenextraktion oder fehlender Analyseplan
War die Recherche ausreichend? Mehrere relevante Datenbanken, Register und vollständige Suchstrings Eine Datenbank, Sprachbeschränkung ohne Begründung, nur publizierte Artikel
War die Auswahl robust? Unabhängige Doppelbeurteilung und dargelegte Ausschlussgründe Ein einzelner Gutachter oder unklare Volltextauswahl
Wurde das Verzerrungsrisiko beurteilt? Designspezifisches Instrument und endpunktspezifische Beurteilung Numerischer Qualitätsscore ohne Domänenbeurteilung
War die Metaanalyse angemessen? Klinisch vergleichbare Studien und vorab festgelegtes Modell Poolen trotz offensichtlich unterschiedlicher Interventionen oder Endpunkte
Ist der Effekt klinisch nachvollziehbar? Relative und absolute Effekte mit Zeithorizont Nur OR, SMD oder P-Wert
Wurde die Heterogenität adressiert? Klinische Erklärung, tau², I² und möglichst Prädiktionsintervall Heterogenität wird ignoriert oder mit zahlreichen Post-hoc-Analysen erklärt
Liegt Berichtsbias vor? Abgleich mit Registern und vorsichtige Interpretation Viele kleine positive Studien und keine unpublizierten Daten
Ist die Schlussfolgerung ausgewogen? Nutzen, Schaden, Präzision und Anwendbarkeit werden gemeinsam abgewogen Schlussfolgerung allein auf Basis statistischer Signifikanz

Forest Plots systematisch lesen

Bei der Beurteilung eines Forest Plots sollte der Leser prüfen:

  1. Welches Effektmaß verwendet wird und welche Richtung einen Nutzen bedeutet.
  2. Wie viele Studien und Teilnehmende tatsächlich beitragen.
  3. Ob große und kleine Studien ähnliche Ergebnisse liefern.
  4. Ob sich die Konfidenzintervalle überlappen.
  5. Ob eine oder zwei Studien das Gewicht dominieren.
  6. Ob der gepoolte Effekt den Nulleffekt kreuzt.
  7. Ob das Intervall sowohl einen klinisch bedeutsamen Nutzen als auch einen klinisch bedeutsamen Schaden ausschließt.
  8. Ob I² und tau² angegeben werden.
  9. Ob das Prädiktionsintervall den Nulleffekt oder eine klinische Entscheidungsschwelle kreuzt.
  10. Ob Studien mit hohem Verzerrungsrisiko die Schlussfolgerung beeinflussen.

Ein Konfidenzintervall, das den Nulleffekt einschließt, bedeutet nicht, dass die Behandlungen gleichwertig sind. Das Intervall kann gleichzeitig sowohl einen erheblichen Nutzen als auch einen erheblichen Schaden umfassen. Die korrekte Bewertung lautet dann, dass die Schätzung unpräzise ist.

Statistische und klinische Bedeutung

Statistische Signifikanz wird von der Stichprobengröße beeinflusst. Ein sehr kleiner Effekt kann in einer großen Metaanalyse statistisch signifikant werden, während ein klinisch bedeutsamer Effekt bei einer kleinen Datenbasis nicht signifikant sein kann.

In einem Cochrane-Review zu Wassertraining bei Knie- oder Hüftarthrose betrug der standardisierte Effekt auf den Schmerz minus 0,31. Auf einer Skala von 0 bis 100 ausgedrückt entsprach dies einer Verbesserung um etwa fünf Punkte [20]. Die Umrechnung auf eine klinisch vertraute Skala macht das Ergebnis besser nutzbar, doch der kleinste klinisch relevante Unterschied muss weiterhin berücksichtigt werden.

Eine umfangreiche Metaanalyse kann zudem Unsicherheit durch Heterogenität verschleiern. Eine Übersichtsarbeit zur TENS schloss 381 randomisierte Studien ein, von denen jedoch nur 26 ein insgesamt niedriges Verzerrungsrisiko aufwiesen. Für den Vergleich mit Placebo lag I² bei 88 Prozent, was zeigt, dass eine große Teilnehmerzahl das Problem variierender Studienergebnisse nicht beseitigt [21].

Aktualisierung und Pflege von Übersichtsarbeiten

Eine systematische Übersichtsarbeit ist bis zu ihrem letzten Recherchedatum aktuell, nicht bis zu ihrem Publikationsdatum. Begutachtung und Publikation können dazu führen, dass die Recherche bereits veraltet ist, wenn der Artikel verfügbar wird.

Living Systematic Reviews beruhen auf wiederholten Recherchen und fortlaufender Aktualisierung. Sie eignen sich am besten, wenn:

  • die Frage eine hohe klinische Priorität hat
  • erhebliche Unsicherheit fortbesteht
  • regelmäßig neue Studien publiziert werden
  • neue Evidenz die Schlussfolgerung oder Empfehlung ändern kann

Die methodische Anleitung für Living Reviews ist für Durchführung und Publikation weiter entwickelt als für Berichterstattung und Qualitätsbewertung. Eine Bestandsaufnahme fand Anleitungen zur Durchführung in 17 Publikationen, zur Qualitätsbewertung jedoch nur in zwei [22]. Aktualisierungsfrequenz, Suchintervalle, auslösende Kriterien für eine neue Analyse und der Zeitpunkt für die Beendigung des Living-Status sollten daher ausdrücklich angegeben werden.

Für Kliniker bedeutet dies, dass eine ältere, aber gut gemachte Übersichtsarbeit nicht automatisch verworfen werden sollte. Zunächst sollte geprüft werden, ob neue Studien die Effektschätzung, das Schadensprofil oder die Vertrauenswürdigkeit der Evidenz wahrscheinlich verändern.

Quellen

  1. Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
  2. Page MJ et al. PRISMA 2020 explanation and elaboration: updated guidance and exemplars for reporting systematic reviews. BMJ 2021. PMID: 33781993
  3. Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
  4. Whiting P et al. ROBIS: A new tool to assess risk of bias in systematic reviews was developed. Journal of Clinical Epidemiology 2016. PMID: 26092286
  5. Balshem H et al. GRADE guidelines: 3. Rating the quality of evidence. Journal of Clinical Epidemiology 2011. PMID: 21208779
  6. Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583
  7. Booth A et al. The nuts and bolts of PROSPERO: an international prospective register of systematic reviews. Systematic Reviews 2012. PMID: 22587842
  8. Rethlefsen ML et al. PRISMA-S: an extension to the PRISMA Statement for Reporting Literature Searches in Systematic Reviews. Systematic Reviews 2021. PMID: 33499930
  9. McGowan J et al. PRESS Peer Review of Electronic Search Strategies: 2015 Guideline Statement. Journal of Clinical Epidemiology 2016. PMID: 27005575
  10. Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
  11. Whiting PF et al. QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies. Annals of Internal Medicine 2011. PMID: 22007046
  12. Higgins JPT et al. Measuring inconsistency in meta-analyses. BMJ 2003. PMID: 12958120
  13. IntHout J et al. Plea for routinely presenting prediction intervals in meta-analysis. BMJ Open 2016. PMID: 27406637
  14. Sterne JA et al. Recommendations for examining and interpreting funnel plot asymmetry in meta-analyses of randomised controlled trials. BMJ 2011. PMID: 21784880
  15. Campbell M et al. Synthesis without meta-analysis in systematic reviews: reporting guideline. BMJ 2020. PMID: 31948937
  16. Hutton B et al. The PRISMA extension statement for reporting of systematic reviews incorporating network meta-analyses of health care interventions: checklist and explanations. Annals of Internal Medicine 2015. PMID: 26030634
  17. Cipriani A et al. Comparative efficacy and acceptability of 21 antidepressant drugs for the acute treatment of adults with major depressive disorder: a systematic review and network meta-analysis. Lancet 2018. PMID: 29477251
  18. Zorzela L et al. PRISMA harms checklist: improving harms reporting in systematic reviews. BMJ 2016. PMID: 26830668
  19. Ilic D et al. Prostate cancer screening with prostate-specific antigen test: a systematic review and meta-analysis. BMJ 2018. PMID: 30185521
  20. Bartels EM et al. Aquatic exercise for the treatment of knee and hip osteoarthritis. Cochrane Database of Systematic Reviews 2016. PMID: 27007113
  21. Johnson MI et al. Efficacy and safety of transcutaneous electrical nerve stimulation for acute and chronic pain in adults: a systematic review and meta-analysis of 381 studies. BMJ Open 2022. PMID: 35144946
  22. Iannizzi C et al. Methods and guidance on conducting, reporting, publishing, and appraising living systematic reviews: a scoping review. Systematic Reviews 2023. PMID: 38098023

Aktualisiert 29. September 2026