Evidenzbasierte Medizin: randomisierte kontrollierte Studien

Zusammenfassung

Eine randomisierte kontrollierte Studie (RCT) vergleicht Interventionen, indem Teilnehmende oder Gruppen zufällig zugeteilt werden. Eine korrekte Randomisierung erzeugt Gruppen, die im Erwartungswert vergleichbar sind, und erlaubt es, einen Unterschied im Endpunkt als kausalen Behandlungseffekt zu interpretieren. Voraussetzung ist, dass die Zuteilungssequenz nicht vorhersagbar ist, dass Protokollabweichungen und Ausfälle korrekt behandelt werden, dass die Endpunkte ohne systematische Unterschiede gemessen werden und dass die Ergebnisse nicht danach ausgewählt werden, was die Analysen zeigen.

Bei der kritischen Bewertung sollte der Kliniker zunächst die Fragestellung der Studie und den Estimand identifizieren, also welcher Behandlungseffekt tatsächlich gemeint ist. Anschließend werden Randomisierung und verdeckte Zuteilung, Verblindung, Ausfälle, Endpunkte, Analyseprinzip und selektives Berichten geprüft. Das Ergebnis ist anhand der Effektgröße und des 95-%-Konfidenzintervalls zu beurteilen, nicht allein anhand des p-Werts. Bei binären Endpunkten werden sowohl relative als auch absolute Effekte benötigt. Abschließend werden klinische Relevanz, Sicherheit und Übertragbarkeit auf den konkreten Patienten bewertet.

CONSORT 2025 legt fest, was eine publizierte RCT mindestens berichten sollte, während SPIRIT 2025 für Studienprotokolle gilt. Die Checklisten verbessern die Transparenz, sind aber keine Instrumente zur Punktbewertung der methodischen Qualität [1,2]. Das Verzerrungsrisiko sollte stattdessen pro Endpunkt mit einem strukturierten Instrument bewertet werden, beispielsweise Cochrane RoB 2 [3].

Die Rolle der RCT in der evidenzbasierten Medizin

Was Randomisierung leistet

In einer RCT wird die Behandlung durch einen Zufallsmechanismus bestimmt. Anders als in einer Beobachtungsstudie wird die Zuteilung daher nicht systematisch durch Prognose, Einschätzung des Behandelnden oder Präferenz des Patienten beeinflusst. Die Randomisierung gleicht im Erwartungswert sowohl bekannte als auch unbekannte prognostische Faktoren aus. Dies ist der wichtigste Grund, warum eine gut durchgeführte RCT in der Regel verlässlichere kausale Evidenz zu Interventionseffekten liefert als ein nicht randomisierter Vergleich.

Die Randomisierung garantiert jedoch nicht, dass die Gruppen identisch sind. Zufällige Unterschiede, auch klinisch große, können auftreten, besonders in kleinen Studien. Unterschiede in den Ausgangsmerkmalen sind daher für sich genommen kein Beleg für eine misslungene Randomisierung. Signifikanztests von Baseline-Variablen sind ungeeignet, da bei korrekter Randomisierung alle Unterschiede durch Zufall entstanden sind.

Eine RCT schützt auch nicht automatisch vor Verzerrungen nach der Randomisierung. Der Effekt kann beispielsweise verzerrt werden durch:

  • Kenntnis der kommenden Zuteilung, bevor der Patient eingeschlossen wird
  • unterschiedliche Begleitbehandlungen oder Nachbeobachtung in den Gruppen
  • Ausfälle, die sowohl von der Behandlung als auch von der Prognose abhängen
  • subjektive Endpunkterhebung ohne Verblindung
  • Analyse in einer anderen Gruppe als der, in die der Teilnehmende randomisiert wurde
  • selektives Berichten von Endpunkten, Zeitpunkten oder Analysen

Metaepidemiologische Forschung hat gezeigt, dass eine mangelhafte oder unklar beschriebene Sequenzgenerierung, verdeckte Zuteilung und Verblindung mit größeren geschätzten Behandlungseffekten assoziiert sind. Der Zusammenhang ist bei subjektiven Endpunkten besonders deutlich. Kleine Studien berichten zudem tendenziell größere Effekte als größere Studien [4].

Was eine RCT beantworten kann und was nicht

RCT eignen sich vor allem für Fragen nach Nutzen und Schaden präventiver, therapeutischer, diagnostischer oder organisatorischer Interventionen. Sie können die Wirkung unter idealisierten Bedingungen (Efficacy) oder die Wirksamkeit in der Routineversorgung (Effectiveness) schätzen.

RCT sind weniger geeignet, wenn:

  • seltene oder sehr späte Schäden die Hauptfrage sind
  • die Exposition nicht ethisch vertretbar zugeteilt werden kann
  • eine lange Latenzzeit die Studie unvertretbar groß oder lang macht
  • Prognose, Prävalenz, Ätiologie oder diagnostische Genauigkeit die eigentliche Frage sind
  • die Intervention bereits so etabliert ist, dass eine Randomisierung gegen Nichtbehandlung unethisch ist

Sicherheitsdaten aus RCT sind häufig durch Patientenauswahl, Nachbeobachtungsdauer und Stichprobengröße begrenzt. Das Fehlen eines statistisch gesicherten Unterschieds bei unerwünschten Wirkungen zeigt daher nicht, dass die Intervention sicher ist. Randomisierte Daten müssen oft durch Register, Pharmakovigilanz und andere Beobachtungsdaten ergänzt werden.

Von der klinischen Frage zum Studiendesign

Fragestellung und Behandlungseffekt formulieren

Die Studie sollte von einer expliziten klinischen Frage ausgehen:

  • Population
  • Intervention
  • Vergleich
  • Endpunkt
  • relevanter Zeitpunkt
  • Versorgungskontext

Es genügt nicht anzugeben, dass zwei Behandlungen verglichen werden sollen. Das Protokoll muss präzisieren, welcher Effekt geschätzt werden soll. Ein Estimand beschreibt in der Praxis:

  1. die Population
  2. die Interventionen
  3. den Endpunkt
  4. wie mit Ereignissen nach der Randomisierung umgegangen wird
  5. das Effektmaß auf Populationsebene

Ereignisse nach der Randomisierung können Absetzen, Therapiewechsel, Zusatzbehandlung, Transplantation oder Tod vor der geplanten Messung sein. Unterschiedliche Arten des Umgangs mit ihnen beantworten unterschiedliche klinische Fragen. Ein Effekt der Behandlungsstrategie kann beispielsweise alle Ereignisse nach der Randomisierung einschließen, während ein hypothetischer Effekt zu schätzen versucht, was geschehen wäre, wenn keine Therapiewechsel stattgefunden hätten.

Ein detailliertes Protokoll und ein statistischer Analyseplan sollten öffentlich zugänglich sein. SPIRIT 2025 nennt 34 Mindestpunkte für Protokolle und betont unter anderem Registrierung, primäre Endpunkte, Schäden, Analysepopulation, Ausfälle, Datenteilung und Patientenbeteiligung [5].

Wahl der Kontrollgruppe

Die Kontrollgruppe bestimmt, welche Frage die Studie beantwortet.

Kontrolle Geeignete Fragestellung Wichtige Einschränkungen
Placebo oder Scheinintervention Spezifischer Effekt über Erwartung, natürlichen Verlauf und Arztkontakt hinaus Kann unethisch sein, wenn eine wirksame Behandlung vorenthalten wird
Keine Intervention Gesamteffekt im Vergleich zum Verzicht Schwer zu verblinden, Risiko von Unterschieden in Zuwendung und Begleitbehandlung
Standardversorgung Effekt der Einführung der Intervention in die aktuelle Praxis Standardversorgung muss beschrieben werden und kann zwischen Zentren variieren
Aktive Kontrolle Vergleich mit etablierter Behandlung Erfordert oft eine größere Studie, insbesondere bei Non-Inferiority
Dosis oder Strategie Welche von mehreren aktiven Strategien am besten ist Unterschiede in Adhärenz und Begleitbehandlung müssen berichtet werden

Eine Placebokontrolle ist methodisch wertvoll, aber nicht immer klinisch relevant. Eine aktive Kontrolle kann Behandlungsentscheidungen besser stützen, das Ergebnis hängt jedoch davon ab, dass die Kontrollbehandlung adäquat verabreicht wird und im untersuchten Kontext die erwartete Wirkung hat.

Wahl der Endpunkte

Der primäre Endpunkt sollte klinisch relevant, klar definiert, validiert und mit ausreichender Präzision messbar sein. Die Definition muss Messmethode, Zeitpunkt, Analyseform und den Umgang mit konkurrierenden Ereignissen umfassen.

Patientenrelevante Endpunkte, beispielsweise Überleben, Symptome, Funktion und Lebensqualität, sind in der Regel unmittelbarer verwertbar als Laborwerte. Surrogatendpunkte können Studien verkürzen, aber irreführend sein, wenn ihr Zusammenhang mit patientenrelevanten Endpunkten nicht für dieselbe Erkrankung, Intervention und denselben Kontext validiert ist. Bei der Berichterstattung über Studien mit Surrogatendpunkten sollte die biologische und empirische Validität des Surrogats klar begründet werden [6].

Kombinierte Endpunkte erhöhen oft die Zahl der Ereignisse, können aber verschleiern, dass der Effekt überwiegend von einer weniger wichtigen und häufigen Komponente getragen wird. Zu beurteilen ist daher:

  • ob die Komponenten eine ähnliche klinische Bedeutung haben
  • ob ihre erwartete Häufigkeit vergleichbar ist
  • ob der Behandlungseffekt plausiblerweise ähnlich ist
  • ob jede Komponente separat berichtet wird

Mehrere primäre Endpunkte, Zeitpunkte und Analysemethoden führen zu Multiplizität. Wird jeder Test auf dem 5-%-Niveau durchgeführt, steigt das Risiko mindestens eines falsch positiven Befunds. Die Strategie zur Kontrolle des Fehlers 1. Art sollte vorab festgelegt sein, beispielsweise hierarchisches Testen oder ein adjustiertes Signifikanzniveau.

Stichprobengröße und Zieldifferenz

Die Fallzahlberechnung sollte auf dem primären Endpunkt und einer klinisch relevanten Zieldifferenz beruhen, nicht auf dem größten Effekt, der die Studie finanziell realisierbar macht. Sie erfordert in der Regel Annahmen über:

  • Signifikanzniveau, häufig zweiseitig 5 Prozent
  • statistische Power, häufig 80 oder 90 Prozent
  • klinisch relevante Zieldifferenz
  • Ereignisrisiko der Kontrollgruppe oder Standardabweichung der Endpunkte
  • Ausfälle
  • Zuteilungsverhältnis
  • Korrelation bei wiederholten Messungen oder Clusterdesign

Wird die nachzuweisende Zieldifferenz halbiert, benötigt eine zweiarmige Studie mit kontinuierlichem, normalverteiltem Endpunkt bei ansonsten unveränderten Annahmen etwa viermal so viele Teilnehmende. Die Wahl der Zieldifferenz hat daher sowohl wissenschaftliche als auch ethische Konsequenzen [7].

Eine kleine Studie kann ein korrektes, aber sehr unpräzises Ergebnis liefern. Ein statistisch nicht signifikantes Ergebnis bedeutet nicht, dass die Behandlungen gleichwertig sind. Das Konfidenzintervall zeigt, welche klinisch bedeutsamen Effekte mit den Daten noch vereinbar sind.

Randomisierung, Zuteilung und Verblindung

Generierung der Randomisierungssequenz

Eine korrekte Sequenz kann mit computergenerierten Zufallszahlen erzeugt werden. Systematisches Alternieren, Geburtsdatum, Aktennummer oder Wochentag sind keine Randomisierung, da die nächste Zuteilung vorhergesagt werden kann.

Gängige Verfahren sind:

  • einfache Randomisierung
  • Blockrandomisierung für annähernd gleich große Gruppen
  • stratifizierte Randomisierung für die Balance innerhalb weniger wichtiger prognostischer Faktoren
  • Minimierung, meist mit einem Zufallselement, bei mehreren Balancierungsfaktoren

Kleine und feste Blöcke können die kommende Zuteilung vorhersagbar machen. Blockgrößen sollten daher häufig variiert und vor dem rekrutierenden Personal verborgen werden.

Verdeckte Zuteilung

Verdeckte Zuteilung (Allocation Concealment) bedeutet, dass die nächste Behandlung nicht vorhergesehen werden kann, bevor der Teilnehmende endgültig eingeschlossen ist. Sie ist von der Verblindung zu unterscheiden, die die Kenntnis der Behandlung nach der Zuteilung betrifft.

Robuste Verfahren sind beispielsweise:

  • zentrale webbasierte Randomisierung
  • zentrale telefonische Randomisierung
  • durch die Apotheke gesteuerte Zuteilung
  • fortlaufend nummerierte, undurchsichtige, versiegelte Umschläge mit Manipulationsschutz, sofern der Ablauf strikt eingehalten wird

Formulierungen wie „die Teilnehmenden wurden randomisiert“ oder „es wurden versiegelte Umschläge verwendet“ sind unzureichend. Der Bericht sollte Sequenzgenerierung beschreiben, wer die Sequenz erstellt hat, wer die Teilnehmenden eingeschlossen hat und wie die Zuteilung verdeckt gehalten wurde. Mängel in diesem Schritt können es ermöglichen zu beeinflussen, welche Patienten welche Behandlung erhalten, und damit die Randomisierung zunichtemachen [4].

Verblindung

Verblindung verringert das Risiko, dass die Kenntnis der Behandlung Verhalten, Begleitbehandlung, Berichterstattung, Messung oder Analyse beeinflusst. Der Bericht sollte angeben, wer verblindet war:

  • Teilnehmende
  • behandelndes Personal
  • übriges medizinisches Personal
  • Endpunktbewerter
  • Datenprüfer und Adjudikationskomitee
  • Statistiker

Die Begriffe einfach- und doppelblind sind mehrdeutig und sollten vermieden werden.

Verblindung ist besonders wichtig bei subjektiven Endpunkten wie Schmerz, Funktion und klinischen Beurteilungen. Bei objektiven Endpunkten wie der Gesamtmortalität ist das Risiko eines Messbias geringer, doch die Kenntnis der Behandlung kann weiterhin Zusatzbehandlung und Nachbeobachtung beeinflussen.

Können Teilnehmende oder Behandelnde nicht verblindet werden, sollte die Studie Folgendes erwägen:

  • verblindete Endpunktbewertung
  • standardisierte Begleitbehandlung
  • objektive oder zentral bewertete Endpunkte
  • vorab festgelegte Kriterien für einen Therapiewechsel
  • verblindete statistische Analyse, wenn möglich

Gängige Studiendesigns

Design Stärke Besonderes Risiko oder Analysefrage
Individuelle Parallelgruppen Einfache Interpretation, meist robust Kontamination zwischen Teilnehmenden, Ausfälle
Clusterrandomisiert Geeignet für Organisations- und Gruppeninterventionen Intraklusterkorrelation, Rekrutierung nach Zuteilung
Crossover-Studie Jeder Teilnehmende ist seine eigene Kontrolle Carry-over-Effekt und Periodeneffekt
Faktoriell Kann mehrere Interventionen effizient prüfen Interaktion zwischen den Interventionen
Pragmatisch Hohe Relevanz für die Routineversorgung Variierende Adhärenz, Begleitbehandlung und Implementierung
Non-Inferiority Vergleicht eine neue Behandlung mit einem wirksamen Standard Wahl der Grenze, Analysepopulation und Assay Sensitivity
Adaptive oder Plattformstudie Kann die Studie nach vorab festgelegten Regeln anpassen Multiplizität, gleichzeitige Kontrollgruppen und zeitliche Veränderungen
Pilot- und Machbarkeitsstudie Prüft, ob eine definitive RCT durchführbar ist Sollte normalerweise nicht für Schlussfolgerungen zum Behandlungseffekt verwendet werden

Clusterrandomisierung

Bei der Clusterrandomisierung werden beispielsweise Primärversorgungszentren, Krankenhäuser oder Kommunen statt einzelner Personen zugeteilt. Das Design wird eingesetzt, wenn sich die Intervention an eine Organisation richtet oder wenn eine individuelle Randomisierung zu erheblicher Kontamination führen würde.

Teilnehmende innerhalb desselben Clusters sind korreliert. Der effektive Informationsgehalt ist daher geringer als bei gleich vielen unabhängigen Personen. Fallzahlberechnung und Analyse müssen die Intraklusterkorrelation berücksichtigen. In einer Übersicht über 300 Clusterstudien berichteten nur 55 Prozent eine Fallzahlberechnung und 35 Prozent ein Maß für die Korrelation innerhalb der Cluster [8].

Ein besonderer Selektionsbias kann entstehen, wenn Personen identifiziert werden, nachdem die Zuteilung des Clusters bekannt geworden ist. In einer systematischen Übersicht über Clusterstudien war etwa ein Viertel potenziell durch das Rekrutierungsverfahren beeinflusst [9]. Einschlusskriterien und Rekrutierung sollten daher nach Möglichkeit vor der Randomisierung festgelegt oder von Personen ohne Kenntnis der Zuteilung durchgeführt werden. CONSORT hat eine eigene Erweiterung für clusterrandomisierte Studien [10].

Crossover-Studien

In einer Crossover-Studie erhält jeder Teilnehmende mehrere Interventionen in randomisierter Reihenfolge. Das Design kann effizient sein bei stabilen chronischen Erkrankungen, rasch reversiblem Behandlungseffekt und Endpunkten, die wiederholt gemessen werden können.

Es ist ungeeignet bei kurativer Behandlung, irreversiblen Endpunkten, rasch progredienter Erkrankung oder lang anhaltendem Behandlungseffekt. Perioden- und Sequenzeffekte müssen berücksichtigt werden. Eine Washout-Phase kann Carry-over verringern, garantiert aber nicht dessen Beseitigung.

Auch Cluster können über die Zeit verschiedenen Behandlungssequenzen randomisiert zugeteilt werden. Dies kann die statistische Effizienz erhöhen, erfordert aber eine Analyse der Korrelation innerhalb der Cluster, der Periodeneffekte und des Carry-over sowohl auf Individual- als auch auf Clusterebene [11].

Pragmatische oder explanatorische Ausrichtung

Pragmatisch und explanatorisch sind die beiden Enden eines Kontinuums. Eine explanatorische Studie fragt vor allem, ob die Intervention unter kontrollierten Bedingungen wirkt. Eine pragmatische Studie fragt, ob sie wirkt, wenn sie in die Regelversorgung eingeführt wird.

Eine pragmatische Ausrichtung umfasst häufig breitere Einschlusskriterien, Standardversorgung als Kontrolle, flexible Behandlung, routinemäßige Begleitbehandlung und patientenrelevante Endpunkte. Der Begriff pragmatisch bedeutet jedoch keine geringeren methodischen Anforderungen. Randomisierung, Zuteilung, Endpunkterhebung und Analyse müssen weiterhin robust sein.

Eine systematische Übersicht über 57 pragmatische Schmerzstudien ergab, dass die Flexibilität der Interventionen und die klinische Relevanz der Endpunkte oft gut waren, während die Rekrutierung und die zusätzliche, von der Studie geforderte Nachbeobachtung weniger repräsentativ für die Routineversorgung waren [12].

Adaptive Studien und Plattformstudien

Eine adaptive Studie kann nach vorab festgelegten Regeln beispielsweise die Stichprobengröße, das Randomisierungsverhältnis oder die fortgeführten Behandlungsarme ändern. Eine Plattformstudie kann innerhalb eines fortlaufenden Protokolls Behandlungen hinzufügen und beenden.

Diese Designs können Ressourcen effizient nutzen, stellen aber besondere Anforderungen an:

  • simulationsbasierte Planung
  • Kontrolle des Fehlers 1. Art
  • unabhängiges Datenmonitoring
  • klare Abbruchregeln
  • Vergleichbarkeit zwischen gleichzeitigen Gruppen
  • Umgang mit zeitlichen Veränderungen in Population und Versorgung
  • Transparenz bezüglich aller Adaptationen

Eine nicht zeitgleiche Kontrollgruppe kann irreführend sein, wenn sich Prognose, Diagnostik oder Standardbehandlung im Zeitverlauf ändern. Die Analyse muss daher den randomisierten zeitgleichen Vergleich vom Vergleich mit historischen oder nicht zeitgleichen Kontrollen trennen.

Pilot- und Machbarkeitsstudien

Die Hauptfrage einer Pilotstudie ist, ob eine künftige definitive Studie durchgeführt werden kann und soll und gegebenenfalls wie. Relevante Endpunkte sind Rekrutierung, Retention, Akzeptanz, Adhärenz, Datenerhebung und vorab festgelegte Kriterien für die weitere Entwicklung.

Pilotstudien sind normalerweise zu klein für eine verlässliche Hypothesenprüfung der klinischen Wirkung. Fehlende statistische Signifikanz belegt nicht das Fehlen eines Effekts, und ein nominell signifikanter Befund ist oft schlecht reproduzierbar. Die CONSORT-Erweiterung für Pilotstudien rät daher von einer formalen Hypothesenprüfung des Effekts ab, wenn die Studie nicht dafür dimensioniert wurde [13].

Analyse randomisierter Studien

Intention-to-Treat und Analyse nach randomisierter Gruppe

Das Grundprinzip einer Superiority-Studie ist, dass die Teilnehmenden in der Gruppe analysiert werden, in die sie randomisiert wurden, unabhängig von Adhärenz, Therapiewechsel oder fälschlich verabreichter Behandlung. Dies bewahrt die prognostische Balance der Randomisierung und schätzt häufig den Effekt der Zuteilung zu einer Behandlungsstrategie.

Der Begriff Intention-to-Treat wird uneinheitlich verwendet. Der Bericht sollte daher genau angeben:

  • welche randomisierten Teilnehmenden eingeschlossen wurden
  • in welcher Gruppe sie analysiert wurden
  • wie mit fehlenden Endpunktdaten umgegangen wurde
  • ob Teilnehmende ausgeschlossen wurden und warum

Eine Per-Protokoll-Analyse umfasst nur Teilnehmende, die bestimmte Protokollanforderungen erfüllt haben. Sie kann klinisch relevant sein, ist aber nicht mehr durch die Randomisierung geschützt. Die Adhärenz kann von Prognose, unerwünschten Wirkungen und frühem Therapieansprechen abhängen. Die Per-Protokoll-Analyse wird daher zu einem nicht randomisierten Vergleich, sofern keine fortgeschrittenen kausalen Methoden eingesetzt werden.

Fehlende Endpunktdaten

Ausfälle verursachen vor allem dann Probleme, wenn die Wahrscheinlichkeit, dass ein Endpunkt fehlt, mit dem tatsächlichen Endpunkt, der Behandlung oder beidem zusammenhängt. Der Anteil der Ausfälle allein reicht daher nicht aus, um einen Bias zu beurteilen.

Gängige Annahmen sind:

  • MCAR, die Ausfälle sind vollständig unabhängig von beobachteten und unbeobachteten Daten
  • MAR, die Ausfälle lassen sich durch beobachtete Daten erklären
  • MNAR, die Ausfälle hängen auch von unbeobachteten Werten ab

Eine Complete-Case-Analyse setzt oft MCAR oder andere starke Bedingungen voraus. Multiple Imputation kann unter MAR angemessen sein, wenn das Imputationsmodell Behandlungsgruppe, prognostische Variablen und Faktoren enthält, die Ausfälle und Endpunkt vorhersagen. Keine statistische Methode kann ohne Annahmen Information wiederherstellen, die nie beobachtet wurde.

Eine methodische Übersicht identifizierte 101 Arbeiten zu Ausfällen. Die meisten behandelten Methoden unter MAR oder MNAR, während viele publizierte RCT weiterhin Methoden verwenden, die in der Praxis die strengere MCAR-Annahme voraussetzen [14]. Die Hauptanalyse sollte daher durch Sensitivitätsanalysen unter klinisch plausiblen MNAR-Szenarien ergänzt werden.

Adjustierte Analysen

Die Adjustierung für starke prognostische Baseline-Variablen kann die Präzision erhöhen. Variablen und Modelle sollten vorab festgelegt werden. Eine Adjustierung für Variablen, die nach der Randomisierung entstanden sind, beispielsweise Adhärenz oder Therapieansprechen, kann einen Bias einführen und die Frage verändern, die die Analyse beantwortet.

Bei kontinuierlichen Endpunkten ist die Adjustierung für den Ausgangswert oft effizienter als die Analyse der Veränderung gegenüber dem Ausgangswert. Bei stratifizierter Randomisierung sollten die Stratifizierungsfaktoren in der Regel in der Analyse berücksichtigt werden.

Subgruppenanalysen

Ein Subgruppeneffekt bedeutet, dass sich der Behandlungseffekt zwischen Gruppen unterscheidet, nicht dass der Effekt in einer Gruppe signifikant und in einer anderen nicht signifikant ist. Die relevante Analyse ist ein Interaktionstest.

Die Glaubwürdigkeit steigt, wenn:

  • die Hypothese und die Richtung des Effekts vorab spezifiziert wurden
  • nur wenige Subgruppen geprüft wurden
  • die Einteilung auf Baseline-Variablen beruht
  • die Interaktion statistisch überzeugend ist
  • dasselbe Muster bei verwandten Endpunkten und in anderen Studien zu sehen ist
  • es eine starke biologische oder klinische Erklärung gibt

Subgruppenanalysen haben oft eine geringe statistische Power, während viele Analysen zugleich ein hohes Risiko falsch positiver Befunde mit sich bringen. In einer Übersicht über RCT zur pulmonalen Hypertonie verwendeten nur 37 Prozent einen Interaktionstest. Die meisten Behauptungen über Subgruppeneffekte erfüllten höchstens vier von zehn Glaubwürdigkeitskriterien [15].

Superiority, Non-Inferiority und Äquivalenz

Superiority

Eine Superiority-Studie prüft, ob eine Intervention besser ist als die Kontrolle. Schließt das Konfidenzintervall den Nulleffekt ein, kann nicht gefolgert werden, dass die Behandlungen gleichwertig sind. Ein nicht signifikantes Ergebnis kann auf tatsächlicher Ähnlichkeit, unzureichender Präzision, schlechter Adhärenz oder hohen Ausfällen beruhen.

Non-Inferiority

Eine Non-Inferiority-Studie prüft, ob die neue Behandlung nicht inakzeptabel schlechter ist als eine etablierte Behandlung. Die Grenze muss vor Studienbeginn festgelegt werden und den größten akzeptablen Wirkungsverlust angeben. Sie sollte sowohl klinisch als auch anhand früherer Evidenz zur Wirkung der Kontrollbehandlung begründet werden [16].

Die neue Behandlung sollte einen anderen Vorteil bieten, beispielsweise:

  • weniger schwerwiegende unerwünschte Wirkungen
  • einfachere Anwendung
  • geringere Kosten
  • bessere Verfügbarkeit
  • weniger invasive Behandlung

Schlechte Adhärenz, Therapiewechsel und unspezifische Endpunkterhebung können die Gruppen einander angleichen und damit die Schlussfolgerung der Non-Inferiority künstlich begünstigen. Sowohl die Analyse nach randomisierter Gruppe als auch die Per-Protokoll-Analyse sollten normalerweise berichtet werden, mit übereinstimmenden Schlussfolgerungen.

Eine systematische Übersicht über 823 Non-Inferiority-Studien ergab, dass die Grenze in etwa 95 Prozent angegeben, aber nur in 57 Prozent der Studien aus dem Jahr 2019 begründet wurde. Weniger als die Hälfte verwendete sowohl eine Intention-to-Treat-ähnliche als auch eine Per-Protokoll-Analyse, und mehr als die Hälfte waren offene Studien [17].

Äquivalenz

Eine Äquivalenzstudie prüft, ob der Behandlungseffekt innerhalb eines vorab festgelegten Intervalls zu beiden Seiten des Nulleffekts liegt. Äquivalenz kann daher nicht mit einem nicht signifikanten Superiority-Test gezeigt werden. Das gesamte Konfidenzintervall muss innerhalb beider Äquivalenzgrenzen liegen.

Interpretation der Ergebnisse

Effektmaße

Für einen binären Endpunkt lässt sich Folgendes berechnen:

  • Risiko in der Interventionsgruppe, EER
  • Risiko in der Kontrollgruppe, CER
  • relatives Risiko, RR = EER / CER
  • absolute Risikodifferenz, RD = EER minus CER
  • relative Risikoreduktion = 1 minus RR, wenn das Risiko sinkt
  • Number Needed to Treat, NNT = 1 / absolute Risikoreduktion

Die NNT ist auf die nächste ganze Zahl aufzurunden und muss zusammen mit Endpunkt, Zeitraum, Kontrollrisiko und Konfidenzintervall angegeben werden. Die NNT ist keine konstante Arzneimitteleigenschaft. Derselbe relative Effekt ergibt bei höherem Ausgangsrisiko einen größeren absoluten Nutzen und eine niedrigere NNT.

Die Odds Ratio kann den Eindruck eines relativen Risikos überzeichnen, wenn der Endpunkt häufig ist. Die Hazard Ratio beschreibt eine relative momentane Ereignisrate und ist nicht direkt gleichbedeutend mit dem relativen Risiko oder einem Unterschied im medianen Überleben. Die Proportionalitätsannahme sollte plausibel sein.

Bei kontinuierlichen Endpunkten sollte die Mittelwertdifferenz vor dem Hintergrund des klinisch bedeutsamen Unterschieds der Skala interpretiert werden. Die standardisierte Mittelwertdifferenz erleichtert den Vergleich zwischen verschiedenen Skalen, wird aber in Standardabweichungen ausgedrückt und ist weniger intuitiv.

p-Wert und Konfidenzintervall

Der p-Wert ist die Wahrscheinlichkeit, unter dem statistischen Modell und der Nullhypothese ein Ergebnis zu erhalten, das mindestens so extrem ist wie das beobachtete. Er ist nicht die Wahrscheinlichkeit, dass die Nullhypothese zutrifft, und gibt weder die Größe noch die klinische Bedeutung des Effekts an.

Ein 95-%-Konfidenzintervall zeigt sowohl Richtung als auch Präzision des Effekts. Bei der Bewertung sollte man fragen:

  1. Schließt das Intervall den Nulleffekt ein?
  2. Schließt es einen klinisch bedeutsamen Nutzen ein?
  3. Schließt es einen klinisch bedeutsamen Schaden ein?
  4. Ist das Intervall schmal genug für eine Entscheidung?

Eine Dichotomisierung bei P = 0,05 ist oft irreführend. Ergebnisse mit P = 0,049 und P = 0,051 unterscheiden sich nicht grundsätzlich. Der Schwerpunkt sollte auf Schätzung, Präzision, Studienqualität und Übereinstimmung mit der übrigen Evidenz liegen.

Die Berichterstattung ist oft schlechter als empfohlen. In einer Übersicht über 88 chirurgische RCT berichteten 68 Prozent nur einen p-Wert und kein 95-%-Konfidenzintervall für den Nutzen. Nur 6 Prozent gaben die NNT an, und keine berichtete die Number Needed to Harm [18].

Nutzen und Schaden

Alle relevanten Endpunkte müssen gegeneinander abgewogen werden. Eine moderate Verringerung eines häufigen leichten Endpunkts kann weniger bedeutsam sein als ein geringer Anstieg eines seltenen schwerwiegenden Schadens.

Zu beurteilen sind:

  • wie unerwünschte Wirkungen definiert und erfragt wurden
  • ob die Erfassung aktiv oder passiv erfolgte
  • Nachbeobachtungsdauer
  • Zahl der exponierten Teilnehmenden
  • Therapieabbrüche aufgrund unerwünschter Wirkungen
  • schwerwiegende Ereignisse und Mortalität
  • absolute Risiken und Konfidenzintervalle

CONSORT Harms empfiehlt eine transparente Darstellung, wie Schäden definiert, erfasst, kodiert und analysiert wurden [19]. RCT sind häufig auf die Wirksamkeit und nicht auf seltene Schäden ausgelegt, wodurch die Unsicherheit bei Sicherheitsendpunkten groß ist.

Kritische Bewertung in der klinischen Praxis

flowchart TD
A["Klinische Frage und<br>relevanten Estimand definieren"] --> B["Protokoll, Register<br>und Publikation vergleichen"]
B --> C["Randomisierung und<br>verdeckte Zuteilung prüfen"]
C --> D["Abweichungen, Verblindung<br>und Begleitbehandlung prüfen"]
D --> E["Ausfälle und<br>Endpunkterhebung prüfen"]
E --> F["Analysegruppe, Multiplizität<br>und Selektion kontrollieren"]
F --> G["Effektgröße und<br>95-%-KI interpretieren"]
G --> H["Absoluten Nutzen<br>gegen Schaden abwägen"]
H --> I["Übertragbarkeit auf Patient<br>und Versorgungskontext beurteilen"]

Schritt 1: Ist die Fragestellung relevant?

Population, Intervention, Vergleich, Endpunkt und Zeitpunkt identifizieren. Prüfen, ob die primäre Fragestellung der Studie Ihrer klinischen Entscheidung entspricht. Eine gut gemachte Studie kann irrelevant sein, wenn Kontrollbehandlung, Dosis oder Versorgungskontext nicht der schwedischen Praxis entsprechen.

Schritt 2: Waren die Methoden vorab festgelegt?

Nach Registrierungsnummer, Protokoll und statistischem Analyseplan suchen. Zu vergleichen sind:

  • primärer Endpunkt
  • Zeitpunkt
  • Stichprobengröße
  • Subgruppen
  • Analysepopulation
  • Abbruchregeln
  • Non-Inferiority-Grenze

Änderungen können gerechtfertigt sein, ihr Zeitpunkt und ihre Gründe sind jedoch anzugeben. Änderungen, die nach Zugang zu den Endpunktdaten vorgenommen wurden, sind mit einem höheren Risiko behaftet, ergebnisgesteuert zu sein.

Schritt 3: Besteht ein Verzerrungsrisiko?

RoB 2 bewertet fünf Hauptdomänen:

  1. den Randomisierungsprozess
  2. Abweichungen von den vorgesehenen Interventionen
  3. fehlende Endpunktdaten
  4. die Messung der Endpunkte
  5. die Auswahl des berichteten Ergebnisses

Die Bewertung sollte sich auf ein bestimmtes Ergebnis beziehen, da sich das Risiko beispielsweise zwischen Mortalität und selbstberichtetem Schmerz unterscheiden kann. RoB 2 liefert die Kategorien niedriges Risiko, einige Bedenken und hohes Risiko, keine numerische Qualitätspunktzahl [3].

Schritt 4: Ist das Ergebnis klinisch bedeutsam?

Von der vorab festgelegten Primäranalyse ausgehen. Nach absoluten Ereigniszahlen, Risikodifferenz und Konfidenzintervall suchen. Beurteilen, ob die Effektgröße eine klinisch bedeutsame Schwelle erreicht und ob sie Kosten, Behandlungslast und Schäden rechtfertigt.

Vorsicht vor Spin. In einer Übersicht über 93 kardiovaskuläre RCT mit nicht signifikantem primärem Endpunkt fand sich eine positiv gefärbte Darstellung in 57 Prozent der Abstracts und 67 Prozent der Haupttexte [20]. Häufige Strategien waren die Hervorhebung signifikanter sekundärer Endpunkte, Subgruppen oder Veränderungen innerhalb der Behandlungsgruppe.

Schritt 5: Ist das Ergebnis übertragbar?

Die interne Validität beantwortet, ob das Ergebnis in der untersuchten Population glaubwürdig ist. Die externe Validität betrifft die Frage, ob das Ergebnis auf andere Patienten und Versorgungssettings angewendet werden kann.

Besonders zu prüfen sind:

  • Alter und Gebrechlichkeit
  • Geschlecht und ethnische Zugehörigkeit
  • Komorbidität und Polypharmazie
  • Krankheitsschwere und Ausgangsrisiko
  • Vorbehandlung
  • Versorgungsstufe und Kompetenz der Behandelnden
  • Adhärenz und Zugang zu Monitoring
  • tatsächliche Dosis und Intensität der Intervention

Eine systematische Übersicht über 305 RCT fand einen medianen Ausschlussanteil von 77,1 Prozent, wenn die Kriterien der Studien auf klinische Populationen angewendet wurden. Häufige Gründe waren Alter, Komorbidität und Begleitmedikation [21]. Relative Effekte lassen sich mitunter zwischen Risikoniveaus übertragen, absolute Effekte und Schäden verändern sich jedoch, wenn sich das Ausgangsrisiko unterscheidet.

Schritt 6: Passt das Ergebnis zur übrigen Evidenz?

Eine einzelne RCT ist selten allein ausschlaggebend. Die Studie ist zusammen zu bewerten mit:

  • anderen RCT
  • systematischen Übersichten und Metaanalysen
  • biologischer Plausibilität
  • Sicherheitsdaten
  • Patientenpräferenzen
  • Ressourcenaufwand und Durchführbarkeit

Große Effekte in einer kleinen, vorzeitig abgebrochenen oder methodisch schwachen Studie erfordern besondere Vorsicht. Replikation in unabhängigen Studien und konsistente absolute Effekte stärken die Verlässlichkeit.

Berichterstattung und Forschungsintegrität

CONSORT 2025 umfasst eine 30-Punkte-Checkliste und den Teilnehmerfluss. Neuere Elemente betreffen unter anderem Datenteilung, Interessenkonflikte, Patientenbeteiligung, Schäden, Analysegruppen, fehlende Daten und die Frage, wie die Intervention tatsächlich umgesetzt wurde [1]. CONSORT ist zusammen mit den relevanten Erweiterungen zu verwenden, beispielsweise für Clusterstudien, Non-Inferiority, adaptive Designs und Pilotstudien.

Ein vollständiger CONSORT-Bericht bedeutet nicht zwangsläufig eine gut gemachte Studie. Die Checkliste gibt an, was berichtet werden soll, nicht welche methodischen Entscheidungen immer korrekt sind. Umgekehrt kann eine methodisch robuste Studie unmöglich zu bewerten sein, wenn die Berichterstattung unvollständig ist.

Eine verlässliche Berichterstattung erfordert:

  • prospektive Registrierung vor der ersten Randomisierung
  • öffentlich zugängliches Protokoll und Analyseplan
  • Darstellung aller wichtigen Protokolländerungen
  • CONSORT-Flussdiagramm
  • Ergebnisse für alle vorab festgelegten primären und sekundären Endpunkte
  • absolute und relative Effekte mit Konfidenzintervallen
  • transparente Berichterstattung über Schäden
  • Finanzierung und Interessenkonflikte
  • Angaben zum Zugang zu anonymisierten Daten und Analysecode

CONSORT 2025 ersetzt CONSORT 2010. Ältere Publikationen müssen selbstverständlich anhand der verfügbaren Informationen bewertet werden, bei Planung, Berichterstattung und Bewertung neuer RCT sollte jedoch die Version von 2025 verwendet werden [1,2].

Quellen

  1. Hopewell S et al. CONSORT 2025 statement: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228833
  2. Hopewell S et al. CONSORT 2025 explanation and elaboration: updated guideline for reporting randomised trials. BMJ 2025. PMID: 40228832
  3. Sterne JAC et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ 2019. PMID: 31462531
  4. Wang H et al. Trial-level characteristics associate with treatment effect estimates: a systematic review of meta-epidemiological studies. BMC Medical Research Methodology 2022. PMID: 35705904
  5. Chan AW et al. SPIRIT 2025 statement: updated guideline for protocols of randomised trials. BMJ 2025. PMID: 40294953
  6. Manyara AM et al. Reporting of surrogate endpoints in randomised controlled trial reports (CONSORT-Surrogate): extension checklist with explanation and elaboration. BMJ 2024. PMID: 38981645
  7. Cook JA et al. Choosing the target difference ('effect size') for a randomised controlled trial: DELTA2 guidance protocol. Trials 2017. PMID: 28606102
  8. Rutterford C et al. Reporting and methodological quality of sample size calculations in cluster randomized trials could be improved: a review. Journal of Clinical Epidemiology 2015. PMID: 25523375
  9. Eldridge S et al. Internal and external validity of cluster randomised trials: systematic review of recent trials. BMJ 2008. PMID: 18364360
  10. Campbell MK et al. Consort 2010 statement: extension to cluster randomised trials. BMJ 2012. PMID: 22951546
  11. McKenzie JE et al. Reporting of cluster randomised crossover trials: extension of the CONSORT 2010 statement with explanation and elaboration. BMJ 2025. PMID: 39761979
  12. Hohenschurz-Schmidt D et al. Pragmatic trials of pain therapies: a systematic review of methods. Pain 2022. PMID: 34490854
  13. Eldridge SM et al. CONSORT 2010 statement: extension to randomised pilot and feasibility trials. BMJ 2016. PMID: 27777223
  14. Medcalf E et al. Addressing missing outcome data in randomised controlled trials: A methodological scoping review. Contemporary Clinical Trials 2024. PMID: 38857674
  15. Rodríguez-Ramallo H et al. Subgroup Analysis in Pulmonary Hypertension-Specific Therapy Clinical Trials: A Systematic Review. Journal of Personalized Medicine 2022. PMID: 35743648
  16. Piaggio G et al. Reporting of noninferiority and equivalence randomized trials: extension of the CONSORT 2010 statement. JAMA 2012. PMID: 23268518
  17. Sengul A et al. Non-Inferiority Trials: A Systematic Review on Methodological Quality and Reporting Standards. Journal of General Internal Medicine 2024. PMID: 38954320
  18. Stubenrouch FE et al. Systematic review of reporting benefits and harms of surgical interventions in randomized clinical trials. BJS Open 2020. PMID: 32207574
  19. Junqueira DR et al. CONSORT Harms 2022 statement, explanation, and elaboration: updated guideline for the reporting of harms in randomised trials. BMJ 2023. PMID: 37094878
  20. Khan MS et al. Level and Prevalence of Spin in Published Cardiovascular Randomized Clinical Trial Reports With Statistically Nonsignificant Primary Outcomes: A Systematic Review. JAMA Network Open 2019. PMID: 31050775
  21. He J et al. Exclusion rates in randomized controlled trials of treatments for physical conditions: a systematic review. Trials 2020. PMID: 32102686

Aktualisiert 29. September 2026