Evidenzbasierte Medizin: Prinzipien und Vorgehen

Zusammenfassung

Evidenzbasierte Medizin bedeutet, die beste verfügbare wissenschaftliche Evidenz mit klinischer Expertise sowie mit den Werten, Zielen und Voraussetzungen der Patientin oder des Patienten zu verbinden. Sie ist nicht gleichbedeutend damit, einen Artikel, eine Metaanalyse oder eine Leitlinie mechanisch zu befolgen. Wissenschaftliche Ergebnisse müssen zunächst hinsichtlich Validität, Effektgröße, Präzision, Relevanz und Anwendbarkeit auf den konkreten Patienten beurteilt werden [1].

Das Vorgehen lässt sich in fünf Schritten zusammenfassen: eine beantwortbare Frage formulieren, nach dem besten verfügbaren Wissen suchen, die Evidenz kritisch bewerten, das Ergebnis gemeinsam mit dem Patienten anwenden und die Folgen der Entscheidung evaluieren [2]. Die Frage sollte nach dem klinischen Fragetyp strukturiert werden, in der Regel mit PICO: Population, Intervention oder Exposition, Vergleich und Endpunkt. Suchen Sie primär nach aktuellen und methodisch verlässlichen Leitlinien oder systematischen Übersichtsarbeiten. Gehen Sie zu Primärstudien über, wenn Übersichtsarbeiten fehlen, zu alt sind oder der Frage nicht entsprechen.

Die kritische Bewertung sollte drei Fragen unterscheiden:

  1. Ist das Ergebnis ausreichend glaubwürdig?
  2. Wie groß und wie präzise ist der Effekt?
  3. Ist das Ergebnis für diesen Patienten und diese Entscheidung relevant?

Relative Effekte sollten durch absolute Zahlen ergänzt werden, beispielsweise absolute Risikoreduktion und Number needed to treat, NNT. Ein niedriger p-Wert beweist weder, dass der Effekt groß, klinisch bedeutsam oder frei von systematischen Fehlern ist. Bei diagnostischen Tests muss das Testergebnis vor dem Hintergrund der Vortestwahrscheinlichkeit interpretiert werden. Bei Leitlinien muss die Stärke der Empfehlung von der Vertrauenswürdigkeit der Evidenz unterschieden werden. Schließlich soll die Entscheidung anhand patientenrelevanter Endpunkte nachverfolgt und überprüft werden, wenn sich Zustand oder Ziele des Patienten oder der Wissensstand ändern.

Grundprinzipien

Was evidenzbasierte Medizin ist

Evidenzbasierte Medizin wurde entwickelt, um klinische Entscheidungen expliziter, reproduzierbarer und transparenter zu machen. Die klassische Definition betont den gewissenhaften und umsichtigen Gebrauch der besten aktuellen Evidenz bei Entscheidungen über einzelne Patienten. Klinische Erfahrung ist erforderlich, um das Problem zu erkennen, das Basisrisiko abzuschätzen, Unsicherheit zu interpretieren und zu beurteilen, ob die Ergebnisse übertragbar sind. Die Präferenzen des Patienten sind notwendig, weil derselbe mögliche Nutzen und Schaden von verschiedenen Menschen unterschiedlich gewichtet werden kann [1].

Der Begriff umfasst sowohl individuelle Patientenentscheidungen als auch Entscheidungen auf Gruppenebene, beispielsweise Versorgungsprogramme, Priorisierungen und den Abbau von Maßnahmen mit geringem Nutzen. Der individuelle Prozess lässt sich in fünf Schritten beschreiben:

Schritt Praktische Bedeutung Häufiger Fehler
Fragen Die Unsicherheit in eine strukturierte klinische Frage überführen Die Frage ist zu breit oder der Endpunkt zu vage
Suchen Die beste verfügbare Wissensquelle identifizieren Man wählt den ersten Treffer oder sucht nur in einer Datenbank
Bewerten Verzerrungsrisiko, Effektgröße, Präzision und Anwendbarkeit beurteilen Man beurteilt das Ansehen der Zeitschrift statt der Methodik der Studie
Anwenden Evidenz mit klinischer Beurteilung und den Zielen des Patienten integrieren Eine Empfehlung wird ohne Individualisierung als Regel angewendet
Evaluieren Prozess, Nutzen, Schaden und Entscheidungsqualität nachverfolgen Die Wirkung der Entscheidung wird nicht überprüft

Das fünfteilige Modell wird auch in der Lehre und bei der Beurteilung evidenzbasierter Medizin verwendet. Eine systematische Übersichtsarbeit validierter Bewertungsinstrumente zeigte, dass die kritische Bewertung häufig gemessen wird, während die Fähigkeit, die Evidenz anzuwenden und die Entscheidung anschließend zu evaluieren, deutlich seltener erfasst wird [2]. Dies spiegelt ein häufiges klinisches Problem wider: Dem Lesen von Artikeln wird viel Aufmerksamkeit gewidmet, weniger jedoch der Frage, wie das Wissen tatsächlich Entscheidungen und Patientenergebnisse verändert.

Was evidenzbasierte Medizin nicht ist

Evidenzbasierte Medizin ist nicht:

  • ein Kochbuch, in dem für alle dieselbe Maßnahme gilt
  • eine Methode, klinische Erfahrung durch Statistik zu ersetzen
  • die Forderung, dass jede Entscheidung durch eine randomisierte Studie gestützt sein muss
  • dasselbe wie Kostenminimierung
  • dasselbe wie das Befolgen einer klinischen Leitlinie
  • die Annahme, dass alle publizierten Studien verlässlich sind
  • die Annahme, dass eine systematische Übersichtsarbeit immer von hoher Qualität ist
  • ein Mehrheitsbeschluss unter Experten

Das Fehlen hochwertiger Evidenz ist kein Beleg für das Fehlen eines Effekts. Bei seltenen Erkrankungen, akut lebensbedrohlichen Zuständen, chirurgischen Interventionen, Langzeitschäden und ethisch schwer untersuchbaren Fragestellungen können randomisierte Studien unmöglich oder ungeeignet sein. Dann muss die Entscheidung auf der besten vorhandenen Evidenz beruhen, wobei die Unsicherheit klar offengelegt wird.

Die Evidenzhierarchie hängt von der Frage ab

Eine einzige allgemeine Evidenzpyramide reicht nicht aus. Welches Studiendesign geeignet ist, hängt davon ab, welche Frage beantwortet werden soll. Eine randomisierte Studie ist in der Regel am besten geeignet, um den kausalen Effekt einer Intervention zu schätzen, nicht aber, um Prävalenz, seltene späte Nebenwirkungen oder die diagnostische Genauigkeit eines Tests zu schätzen.

Klinische Frage In der Regel informativstes Studiendesign Zentrale Bewertungsfragen
Therapie oder Prävention Systematische Übersichtsarbeit randomisierter Studien, danach einzelne randomisierte Studie Randomisierung, verdeckte Zuteilung, Studienabbrüche, Verblindung, Adhärenz
Diagnostik Querschnittsstudie oder prospektive Kohorte mit relevantem Referenzstandard Patientenauswahl, verblindete Interpretation, Verifikationsbias, Schwellenwert
Prognose Prospektive Kohorte, möglichst mit externer Validierung Repräsentativer Ausgangszeitpunkt, Studienabbrüche, Endpunkterhebung, Kalibrierung
Ätiologie oder Schaden Kohorten- oder Fall-Kontroll-Studie, gelegentlich randomisierte Studie Confounding, Dosis-Wirkungs-Beziehung, zeitliche Abfolge, Selektion, Fehlklassifikation
Prävalenz Repräsentative Querschnittsstudie Auswahlrahmen, Teilnahme, Definition und Messung
Patientenerfahrungen Qualitative Studie oder qualitative Evidenzsynthese Zweckgerichtete Stichprobe, Datensättigung, Reflexivität und Analyse
Implementierung Pragmatische randomisierte Studie, clusterrandomisierte Studie oder kontrollierte Zeitreihe Kontext, Umsetzungsgrad, Kontamination und Nachhaltigkeit

Auch Übersichtsarbeiten verfolgen unterschiedliche Zwecke. Eine systematische Übersichtsarbeit beantwortet eine eingegrenzte Frage mit vorab festgelegten Methoden. Ein Scoping Review kartiert ein breiteres Gebiet und muss keine Effekte bewerten. Eine narrative Übersicht kann klinisches Verständnis vermitteln, hängt aber stärker von der Auswahl der Autoren ab. Ein Umbrella Review fasst vorhandene systematische Übersichtsarbeiten zusammen. Diese Publikationstypen sind daher nicht austauschbar [3].

Vorgehen

flowchart TD
A["Klinische Unsicherheit<br>identifizieren"] --> B["Frage formulieren<br>mit PICO oder Entsprechendem"]
B --> C["Fragetyp und relevantes<br>Studiendesign festlegen"]
C --> D["Zuerst nach aktueller Leitlinie<br>oder systematischer Übersicht suchen"]
D --> E["Aktualität, Methodik<br>und Relevanz beurteilen"]
E -->|"Ausreichende Evidenz"| F["Nutzen, Schaden<br>und Unsicherheit quantifizieren"]
E -->|"Unzureichende Evidenz"| G["Relevante<br>Primärstudien suchen"]
G --> H["Verzerrungsrisiko und<br>Präzision kritisch bewerten"]
H --> F
F --> I["Anwendbarkeit, Basisrisiko<br>und Umsetzbarkeit beurteilen"]
I --> J["Alternativen mit dem<br>Patienten besprechen"]
J --> K["Gemeinsame Entscheidung<br>treffen und dokumentieren"]
K --> L["Endpunkte, Nebenwirkungen<br>und Entscheidung nachverfolgen"]
L --> M["Bei neuer Evidenz oder geänderten<br>Voraussetzungen überprüfen"]

Schritt 1: Die Entscheidung identifizieren und die Frage formulieren

Gehen Sie von einer realen Entscheidung aus, nicht von einem allgemeinen Wissensgebiet. Die Frage „Welche Behandlung ist bei Vorhofflimmern am besten?“ ist zu breit. Eine brauchbarere Frage definiert die Patientengruppe, die Alternativen und die Endpunkte, die die Entscheidung verändern können.

Für Therapiefragen wird in der Regel PICO verwendet:

  • P, Population: Diagnose, Schweregrad, Alter, Komorbidität und Versorgungssetting
  • I, Intervention: Behandlung, diagnostische Strategie oder andere Maßnahme
  • C, Comparison: Placebo, Standardversorgung, andere aktive Behandlung oder keine Maßnahme
  • O, Outcome: patientenrelevante Wirkungen und Schäden
  • T, Time: ein relevanter Zeithorizont kann ergänzt werden, wenn der Endpunkt zeitabhängig ist

Beispiel:

Senken bei Personen über 75 Jahre mit nicht valvulärem Vorhofflimmern und hohem Blutungsrisiko direkte orale Antikoagulanzien im Vergleich zu Warfarin das Risiko eines ischämischen Schlaganfalls ohne inakzeptablen Anstieg schwerer Blutungen über zwei Jahre?

Bei diagnostischen Fragen wird die Intervention durch den Indextest und der Vergleich durch den Referenzstandard ersetzt. Bei Prognosefragen werden Ausgangszeitpunkt, prognostischer Faktor oder Modell, Endpunkt und Zeitraum definiert. Bei Fragen zu Schäden werden die Exposition und eine relevante nicht exponierte Vergleichsgruppe definiert.

Der Endpunkt sollte für den Patienten bedeutsam sein. Mortalität, Symptome, Funktion, Lebensqualität, Krankenhausaufnahme und schwere Nebenwirkungen sind meist unmittelbarer relevant als Laborwerte oder radiologische Surrogatparameter. Ein Surrogatendpunkt kann nützlich sein, wenn sein Zusammenhang mit dem Patientennutzen gut validiert ist, doch eine Verbesserung eines Biomarkerwertes darf nicht automatisch als verbesserte Gesundheit interpretiert werden.

Schritt 2: Effizient und reproduzierbar suchen

Die Suche sollte an den Zeitrahmen und die Tragweite der Entscheidung angepasst werden. Bei einer akuten Patientenfrage kann eine validierte Wissenszusammenfassung angemessen sein. Bei der Erstellung einer Leitlinie oder eines Versorgungsprogramms ist eine dokumentierte, reproduzierbare und breitere Suche erforderlich.

Eine praktische Suchreihenfolge ist:

  1. Aktuelle nationale oder internationale Leitlinie.
  2. Systematische Übersichtsarbeit oder Metaanalyse.
  3. Neuere randomisierte oder gut durchgeführte Beobachtungsstudien, die nach dem letzten Suchdatum der Übersichtsarbeit publiziert wurden.
  4. Einzelne Primärstudien, wenn Synthesen fehlen.
  5. Expertenkonsens, wenn die empirische Evidenz unzureichend ist.

Prüfen Sie stets:

  • wann die Literatursuche abgeschlossen wurde
  • ob Population, Intervention und Endpunkte der Frage entsprechen
  • ob das Dokument ersetzt oder aktualisiert wurde
  • ob die Empfehlung auf ein anderes Gesundheitssystem zugeschnitten ist
  • ob Arzneimittel, Diagnostik oder Nachsorge in Schweden verfügbar sind

Leitlinien sollten nicht allein aufgrund ihres Herausgebers akzeptiert werden. In einer systematischen Bewertung von 40 Leitlinien zur atopischen Dermatitis variierte die methodische Qualität stark. Anwendbarkeit und methodische Strenge waren die schwächsten Bereiche, und der Umgang mit Interessenkonflikten war häufig unzureichend [4]. Schwedische regulatorische Bedingungen, Erstattungseinschränkungen und organisatorische Voraussetzungen können zudem von internationalen Empfehlungen abweichen.

Praktische PubMed-Suche

Beginnen Sie mit den Kernbegriffen aus PICO. Verwenden Sie sowohl Schlagwörter als auch Freitext, wenn die Suche vollständig sein muss. Vermeiden Sie es, alle denkbaren Patientenmerkmale direkt aufzunehmen, da sonst relevante Studien übersehen werden können.

Eine vereinfachte Struktur für eine Therapiefrage ist:

(population OR synonym) AND (intervention OR synonym) AND
(randomized controlled trial OR systematic review)

Suchen Sie nicht routinemäßig nach einem erwarteten Endpunkt wie „mortality“, wenn dadurch Studien ausgeschlossen werden könnten, in denen der Endpunkt nur im Volltext vorkommt. Dokumentieren Sie Datenbank, Datum, vollständigen Suchstring und etwaige Filter, wenn die Suche überprüfbar oder wiederholbar sein soll.

Schritt 3: Die richtige Wissensquelle wählen

Eine gut durchgeführte systematische Übersichtsarbeit ist oft am effizientesten, weil sie den gesamten Forschungsstand zusammenfasst. Sie ist jedoch nur so verlässlich wie ihre Methoden und die eingeschlossenen Studien. Eine Metaanalyse ist eine statistische Methode, kein Qualitätssiegel.

GRADE wird verwendet, um die Vertrauenswürdigkeit eines Gesamtbestandes an Evidenz für jeden wichtigen Endpunkt zu beurteilen. Die Bewertung umfasst unter anderem Verzerrungsrisiko, Inkonsistenz, Indirektheit, unzureichende Präzision und Publikationsbias. Die Evidenz wird als von hoher, moderater, niedriger oder sehr niedriger Vertrauenswürdigkeit eingestuft [5].

Systematische Übersichtsarbeiten sollten Fragestellung, Protokoll, Suche, Auswahl, Verzerrungsrisiko, Synthese und Evidenzbewertung darlegen. PRISMA 2020 enthält zu diesem Zweck 27 Berichtspunkte und ein Flussdiagramm [6]. PRISMA beschreibt die Berichterstattung, nicht die methodische Qualität. Eine vollständige Checkliste garantiert daher nicht, dass die Übersichtsarbeit gut durchgeführt wurde. Zur methodischen Bewertung von Übersichtsarbeiten zu Interventionen kann AMSTAR 2 verwendet werden. Das Instrument umfasst Übersichtsarbeiten sowohl randomisierter als auch nicht randomisierter Studien [7].

Kritische Bewertung

Mit der Methodik beginnen, nicht mit den Ergebnissen

Die Lektüre sollte in folgender Reihenfolge erfolgen:

  1. Forschungsfrage und Studiendesign.
  2. Population, Einschlusskriterien und Versorgungssetting.
  3. Intervention oder Exposition und Vergleich.
  4. Endpunkte und Nachbeobachtungszeit.
  5. Methoden zur Begrenzung systematischer Fehler.
  6. Studienabbrüche und fehlende Daten.
  7. Effektgröße und Konfidenzintervall.
  8. Finanzierung, Protokoll, Registrierung und Interessenkonflikte.
  9. Erst danach die Schlussfolgerung der Autoren.

Abstract und Diskussionsteil reichen für eine vollständige Qualitätsbewertung nicht aus. Prüfen Sie bei wichtigen Entscheidungen Tabellen, Abbildungen, Supplemente, Studienprotokoll und statistischen Analyseplan.

Berichtsleitlinien erleichtern die Lektüre. CONSORT gilt für randomisierte Parallelgruppenstudien [8], STROBE für Beobachtungsstudien [9], STARD für Studien zur diagnostischen Genauigkeit [10] und TRIPOD für diagnostische oder prognostische Vorhersagemodelle [11]. Diese Leitlinien verbessern die Transparenz, ersetzen jedoch keine Bewertung des Verzerrungsrisikos.

Randomisierte Interventionsstudien

Die Randomisierung verringert Confounding, indem sie sowohl bekannte als auch unbekannte prognostische Faktoren auf die Gruppen verteilt. Dieser Vorteil kann durch mangelhafte Zuteilung, selektive Studienabbrüche, Crossover oder eine ungeeignete Analyse verloren gehen.

Beurteilen Sie insbesondere:

  • War die Randomisierungssequenz tatsächlich zufällig?
  • War die Zuteilung bis zum Einschluss verdeckt?
  • Waren Teilnehmende, Behandelnde und Endpunkterheber, soweit möglich, verblindet?
  • Wurden die Gruppen abgesehen von der Intervention gleich behandelt?
  • War der Endpunkt vorab definiert, relevant und auf dieselbe Weise gemessen?
  • Waren die Studienabbrüche gering und gleichmäßig verteilt?
  • Wurden die Teilnehmenden hauptsächlich gemäß der ursprünglichen Gruppenzuteilung analysiert?
  • Wurden alle vorab definierten Endpunkte berichtet?
  • Wurde die Studie nach einem unerwartet großen Effekt vorzeitig abgebrochen?
  • War die Studie sowohl für den Nutzen als auch für wichtige Schäden ausreichend dimensioniert?

Die Intention-to-treat-Analyse schätzt den Effekt der Zuteilung zu einer Strategie und erhält in der Regel die durch die Randomisierung erreichte Vergleichbarkeit. Die Per-Protokoll-Analyse schätzt den Effekt bei denjenigen, die das Protokoll eingehalten haben, kann aber Confounding wieder einführen. Beide können relevant sein, beantworten jedoch unterschiedliche Fragen.

Clusterstudien erfordern eine spezielle Analyse, da Patienten innerhalb derselben Versorgungseinheit statistisch nicht unabhängig sind. Bei Crossover-Studien müssen ein möglicher Carry-over-Effekt der Behandlung und eine ausreichende Washout-Phase beurteilt werden.

Beobachtungsstudien

Beobachtungsstudien sind zentral für Prognose, Prävalenz, Diagnostik, seltene Schäden und Langzeitwirkungen. Sie können auch wertvolle Informationen über Behandlungseffekte liefern, wenn eine Randomisierung nicht durchführbar ist. Ihre Ergebnisse sind jedoch anfälliger für Selektionsbias, Informationsbias und Confounding [12].

Häufige Probleme sind:

Problem Beispiel Folge
Confounding by indication Schwerer Erkrankte erhalten eine bestimmte Behandlung Die Behandlung kann fälschlich als schädlich erscheinen
Selektionsbias Teilnahme oder Nachbeobachtung hängt von der Prognose ab Die Vergleichsgruppen unterscheiden sich systematisch
Fehlklassifikation Diagnose oder Arzneimittelexposition wird falsch erfasst Der Zusammenhang wird abgeschwächt oder verzerrt
Immortal time bias Der Expositionsstatus setzt ein Überleben bis zu einem späteren Zeitpunkt voraus Die Behandlung kann fälschlich als protektiv erscheinen
Healthy user bias Behandelte Personen zeigen auch andere gesundheitsfördernde Verhaltensweisen Der Effekt wird überschätzt
Informative Zensierung Ausscheiden hängt mit Prognose oder Behandlungseffekt zusammen Die verbleibenden Teilnehmenden sind nicht repräsentativ
Residual confounding Eine wichtige Variable fehlt oder wird nur grob gemessen Die adjustierte Analyse ist weiterhin verzerrt

In einer Bestandsaufnahme methodischer Probleme in Studien auf Basis von Versorgungsdatenbanken war Confounding die häufigste Hauptkategorie. Confounding by indication, Residual confounding, Fehlklassifikation von Endpunkten und Immortal time bias waren besonders ausgeprägt [13].

Regressionsadjustierung, Matching und Propensity-Score-Methoden können gemessene Faktoren ausbalancieren, ungemessene Confounder jedoch nicht sicher eliminieren. Der Propensity Score sollte daher nicht als statistischer Ersatz für die Randomisierung betrachtet werden. Die Methode kann randomisierte Daten ergänzen und die Vergleichbarkeit in Beobachtungsdaten verbessern, das Ergebnis hängt jedoch davon ab, welche Variablen gemessen wurden, wie das Modell spezifiziert wurde und ob sich die Behandlungsgruppen ausreichend überlappen [14].

Eine große Datenbank oder ein sehr schmales Konfidenzintervall behebt keine systematischen Fehler. Im Gegenteil kann ein enges Konfidenzintervall ein falsches Gefühl der Sicherheit bezüglich eines verzerrten Schätzwertes vermitteln.

Diagnostische Studien

Ein diagnostischer Test sollte in der Population und der klinischen Situation evaluiert werden, in der er eingesetzt werden soll. Fall-Kontroll-ähnliche Studien mit eindeutig erkrankten Patienten und völlig gesunden Kontrollen neigen dazu, die diagnostische Genauigkeit des Tests zu überschätzen.

Die grundlegenden Maße sind:

  • Sensitivität: Anteil der Erkrankten mit positivem Test.
  • Spezifität: Anteil der Nichterkrankten mit negativem Test.
  • Positive Likelihood Ratio: Sensitivität / (1 - Spezifität).
  • Negative Likelihood Ratio: (1 - Sensitivität) / Spezifität.
  • Positiver prädiktiver Wert: Wahrscheinlichkeit einer Erkrankung bei positivem Test.
  • Negativer prädiktiver Wert: Wahrscheinlichkeit des Fehlens einer Erkrankung bei negativem Test.

Prädiktive Werte werden stark von der Krankheitsprävalenz beeinflusst und lassen sich nicht unkritisch zwischen Primärversorgung, Notaufnahme und Spezialklinik übertragen. Likelihood Ratios können zur Aktualisierung der Odds verwendet werden:

Vortest-Odds = Vortestwahrscheinlichkeit / (1 - Vortestwahrscheinlichkeit)

Nachtest-Odds = Vortest-Odds × Likelihood Ratio

Nachtestwahrscheinlichkeit = Nachtest-Odds / (1 + Nachtest-Odds)

Testen ist am wertvollsten, wenn das Ergebnis die Wahrscheinlichkeit über eine klinische Entscheidungsschwelle verschieben kann. Ein Test ist weniger nützlich, wenn unabhängig vom Ergebnis behandelt werden soll oder wenn kein mögliches Ergebnis eine Behandlung rechtfertigen würde. Sensitivität und Spezifität verändern sich zudem, wenn der Schwellenwert geändert wird. Die ROC-Kurve zeigt die Diskriminationsfähigkeit des Tests über mehrere Schwellenwerte, gibt aber allein nicht an, welcher Schwellenwert klinisch angemessen ist [15].

Systematische Übersichtsarbeiten und Metaanalysen

Prüfen Sie, ob die Übersichtsarbeit Folgendes aufweist:

  • ein vorab registriertes oder datiertes Protokoll
  • explizite Einschlusskriterien
  • eine ausreichend breite und aktuelle Suche
  • eine unabhängige Prüfung durch mindestens zwei Personen
  • eine Darstellung der ausgeschlossenen Volltextartikel
  • eine Bewertung des Verzerrungsrisikos je relevantem Endpunkt
  • eine begründete Synthesemethode
  • eine Analyse der klinischen und statistischen Heterogenität
  • eine Bewertung des Publikationsbias, soweit möglich
  • eine Darstellung absoluter Effekte und der Vertrauenswürdigkeit der Evidenz

Statistische Heterogenität sollte nicht allein anhand von I² beurteilt werden. Auch Unterschiede in Population, Dosis, Intervention, Nachbeobachtung, Definitionen und Verzerrungsrisiko müssen analysiert werden. Ein gepoolter Schätzwert kann irreführend sein, wenn sich die Studien nicht auf dieselbe klinische Frage beziehen.

Eine Netzwerk-Metaanalyse kann mehrere Behandlungen anhand sowohl direkter als auch indirekter Evidenz vergleichen. Die Methode setzt eine plausible Transitivität voraus, das heißt, die Effektmodifikatoren der Studien müssen für indirekte Vergleiche ausreichend vergleichbar sein. Rangfolgen von Behandlungen sollten nicht ohne Effektgrößen, Konfidenzintervalle, Inkonsistenzanalyse und Bewertung der Vertrauenswürdigkeit der Evidenz gelesen werden [16].

Interpretation von Effektmaßen

Relative und absolute Effekte

Für einen dichotomen Endpunkt gilt:

Risiko in der Kontrollgruppe = Ereignisse in der Kontrollgruppe / Anzahl in der Kontrollgruppe

Risiko in der Interventionsgruppe = Ereignisse in der Interventionsgruppe / Anzahl in der Interventionsgruppe

Relatives Risiko, RR = Interventionsrisiko / Kontrollrisiko

Relative Risikoreduktion = 1 - RR

Absolute Risikoreduktion, ARR = Kontrollrisiko - Interventionsrisiko

NNT = 1 / ARR

Sinkt das Risiko von 10 Prozent auf 8 Prozent, beträgt das RR 0,80, die relative Risikoreduktion 20 Prozent, die ARR 2 Prozentpunkte und die NNT 50 im untersuchten Zeitraum. Gilt dasselbe RR bei einem Basisrisiko von 1 Prozent, beträgt die ARR 0,2 Prozentpunkte und die NNT 500. Der relative Effekt ist derselbe, der klinische Nutzen unterscheidet sich jedoch erheblich.

Die NNT sollte stets zusammen mit folgenden Angaben genannt werden:

  • Endpunkt
  • Zeitraum
  • Vergleich
  • Patientengruppe oder Basisrisiko
  • Konfidenzintervall, sofern vorhanden

Für Schäden werden entsprechend die absolute Risikozunahme und die Number needed to harm, NNH, verwendet. NNT und NNH sollten nicht mechanisch verglichen werden, wenn sich die Endpunkte im Schweregrad unterscheiden.

Die Odds Ratio kann das relative Risiko annähern, wenn das Ereignis selten ist, überschätzt jedoch oft den relativen Effekt, wenn der Endpunkt häufig ist. Die Hazard Ratio beschreibt relative Ereignisraten über die Zeit und lässt sich ohne zusätzliche Informationen nicht direkt in ein Risikoverhältnis übertragen.

Kontinuierliche Endpunkte

Die Mittelwertdifferenz ist am leichtesten zu interpretieren, wenn alle Studien dieselbe Skala verwenden. Die standardisierte Mittelwertdifferenz wird verwendet, wenn verschiedene Skalen dasselbe Konstrukt messen; sie wird jedoch in Standardabweichungen ausgedrückt und ist klinisch weniger intuitiv.

Statistische Signifikanz ist von klinischer Bedeutsamkeit zu unterscheiden. Eine sehr große Studie kann einen kleinen Unterschied nachweisen, den der Patient nicht bemerkt. Die minimale klinisch relevante Differenz kann hilfreich sein, ihr Wert hängt jedoch von Population, Messinstrument, Ausgangslage und Methode ab. Ein Schwellenwert aus einem anderen Schweregrad oder einer anderen Intervention sollte nicht ohne Prüfung seiner Relevanz verwendet werden [17].

Konfidenzintervalle und p-Werte

Der p-Wert gibt an, wie unvereinbar die beobachteten Daten mit einer spezifizierten statistischen Nullhypothese sind, gegeben die Annahmen des Modells. Er gibt weder die Wahrscheinlichkeit an, dass die Hypothese zutrifft, noch die Wahrscheinlichkeit, dass das Ergebnis auf Zufall beruht, noch die klinische Bedeutung des Effekts.

Das Konfidenzintervall zeigt sowohl Richtung als auch Präzision. Fragen Sie:

  • Schließt das Intervall keinen Effekt ein?
  • Schließt es einen klinisch relevanten Nutzen ein?
  • Schließt es einen klinisch relevanten Schaden ein?
  • Ist das Intervall so breit, dass mehrere unterschiedliche Entscheidungen weiterhin vertretbar sind?

Ein nicht signifikantes Ergebnis kann auf unzureichender Präzision beruhen und ist nicht automatisch gleichbedeutend mit dem Nachweis, dass kein Effekt besteht. Äquivalenz und Nichtunterlegenheit erfordern spezielle, vorab festgelegte Margen und Analyseprinzipien.

Ein klinisches Beispiel für den absoluten Effekt

In einer Metaanalyse zum PSA-basierten Prostatakarzinom-Screening entsprach eine mögliche relative Senkung der prostatakarzinomspezifischen Mortalität in der methodisch stärksten Studie etwa einem Todesfall weniger pro 1 000 gescreente Männer über zehn Jahre. Gleichzeitig nahmen Diagnosen und behandlungsbedingte Komplikationen zu. Das Beispiel zeigt, warum relative Effektmaße, absolute Zahlen, Zeithorizont und Schäden gemeinsam dargestellt werden müssen [18].

Bewertung der Vertrauenswürdigkeit der Evidenz

GRADE bewertet die Evidenz pro Endpunkt, nicht pro Artikel. Eine Studie kann daher für die Mortalität eine verlässlichere Evidenz liefern als für Lebensqualität oder Nebenwirkungen.

GRADE-Domäne Frage bei der Bewertung
Verzerrungsrisiko Kann die Durchführung der Studien das Ergebnis systematisch verzerrt haben?
Inkonsistenz Unterscheiden sich Größe oder Richtung des Effekts zwischen Studien ohne plausible Erklärung?
Indirektheit Weichen Population, Intervention, Vergleich oder Endpunkt von der Entscheidung ab?
Unzureichende Präzision Ist das Konfidenzintervall so breit, dass unterschiedliche klinische Entscheidungen möglich sind?
Publikationsbias Könnten negative oder kleine Studien fehlen?

Randomisierte Studien beginnen in der Regel als Evidenz mit hoher Vertrauenswürdigkeit und können herabgestuft werden. Beobachtungsstudien beginnen in der Regel niedriger, können aber in bestimmten Situationen heraufgestuft werden, beispielsweise bei sehr großem Effekt, einer Dosis-Wirkungs-Beziehung oder wenn verbleibendes Confounding den beobachteten Effekt wahrscheinlich verringern würde [5].

Eine starke Empfehlung kann mitunter trotz niedriger Vertrauenswürdigkeit der Evidenz ausgesprochen werden, beispielsweise wenn ein lebensbedrohlicher Schaden plausibel und die Alternative einfach und sicher ist. Umgekehrt kann eine bedingte Empfehlung trotz hoher Vertrauenswürdigkeit der Evidenz angemessen sein, wenn Nutzen und Schaden nahe beieinanderliegen oder die Werte der Patienten variieren.

Von der Evidenz zur Patientenentscheidung

Anwendbarkeit

Nach der kritischen Bewertung ist Folgendes zu beurteilen:

  • Ähnelt der Patient den Studienteilnehmenden hinsichtlich Schweregrad, Alter und Komorbidität?
  • Ist das Basisrisiko des Patienten höher oder niedriger?
  • Sind Dosis, Intensität und Nachsorge der Intervention umsetzbar?
  • Hat der Patient Kontraindikationen oder eine besondere Anfälligkeit für Schäden?
  • Wurden Endpunkte gemessen, die dem Patienten wichtig sind?
  • Ist der Zeithorizont im Hinblick auf die Lebenserwartung und das Behandlungsziel relevant?
  • Bestehen konkurrierende Risiken?
  • Welche praktischen Kosten, Kontrollen und Behandlungslasten kommen hinzu?
  • Entspricht die Vergleichsbehandlung der aktuellen schwedischen Versorgung?

Multimorbidität kann dazu führen, dass einzelne Leitlinien einander widersprechen. Eine Kombination mehrerer evidenzbasierter Empfehlungen ist nicht automatisch evidenzbasiert, wenn sie zu Polypharmazie, unzumutbarer Behandlungslast oder sich verstärkenden Nebenwirkungen führt. Priorisieren Sie dann die Endpunkte, die für den Patienten am wichtigsten sind, und berücksichtigen Sie die Zeit bis zum erwarteten Nutzen.

Partizipative Entscheidungsfindung

Wenn mehrere vertretbare Alternativen bestehen, sollte die Ärztin oder der Arzt darlegen:

  1. dass eine Entscheidung getroffen werden muss
  2. welche Alternativen bestehen, einschließlich des Verzichts
  3. den erwarteten absoluten Nutzen und Schaden
  4. die Unsicherheit der Schätzungen
  5. die praktischen Konsequenzen
  6. welche Endpunkte der Patient am höchsten gewichtet

Patientenentscheidungshilfen können Wissen, Risikowahrnehmung und Beteiligung verbessern. Ein Cochrane-Review mit 209 Studien und 107 698 Teilnehmenden zeigte, dass Entscheidungshilfen die Übereinstimmung zwischen informierten Werten und Wahl wahrscheinlich erhöhten. Sie verbesserten zudem Wissen und korrekte Risikowahrnehmung ohne nachgewiesene Zunahme von Entscheidungsreue [19].

Risiken sollten möglichst als natürliche Häufigkeiten mit demselben Nenner ausgedrückt werden, beispielsweise „8 von 100 im Vergleich zu 10 von 100 über fünf Jahre“. Vermeiden Sie es, den Nutzen als relative Risikoreduktion und den Schaden als absolute Risikozunahme darzustellen. Verwenden Sie für beide denselben Zeithorizont und dasselbe visuelle Format.

Dokumentieren Sie nach Möglichkeit:

  • welche Entscheidung getroffen wurde
  • welche Alternativen besprochen wurden
  • den geschätzten Nutzen und Schaden
  • die wichtigsten Ziele des Patienten
  • verbleibende Unsicherheit
  • die geplante Nachsorge und die Kriterien für eine erneute Überprüfung

Nachverfolgung, Implementierung und Überprüfung

Evidenzbasierte Medizin endet nicht mit der Entscheidung. Evaluieren Sie, ob die Intervention umgesetzt wurde, ob sie die beabsichtigte Wirkung hatte und ob unerwünschte Folgen auftraten.

Auf individueller Ebene sollte die Nachverfolgung Folgendes umfassen:

  • patientenrelevante Wirkung
  • Nebenwirkungen und Behandlungslast
  • Adhärenz und Umsetzbarkeit
  • veränderte Präferenzen
  • neue Kontraindikationen oder konkurrierende Risiken
  • Bedarf an Dosisanpassung, Absetzen oder einer alternativen Strategie

Auf Einrichtungsebene lassen sich die Einhaltung eines empfohlenen Prozesses, unerwünschte Variation, Patientenergebnisse, Chancengleichheit, Ressourcenverbrauch sowie das Auftreten von Überdiagnostik oder Low-Value Care messen.

Fortbildung allein bewirkt oft nur begrenzte Veränderungen. Ein Cochrane-Review von 215 Studien ergab, dass Fortbildungsveranstaltungen wahrscheinlich zu einer geringen Verbesserung der klinischen Praxis und zu einer kleineren Verbesserung der Patientenergebnisse führten. Der Effekt variierte und schien durch mehrere zusammenwirkende Strategien verstärkt werden zu können [20]. Für die Implementierung können daher Kombinationen aus lokalen Versorgungsprozessen, Feedback, Erinnerungen, Verantwortungszuweisung und Zugang zu Entscheidungsunterstützung erforderlich sein.

Elektronische Erinnerungen sind keine Universallösung. Eine systematische Übersichtsarbeit von 54 randomisierten Studien in der Primärversorgung fand Verbesserungen vor allem bei der Dokumentation und bei bestimmten patientenzentrierten Prozessmaßen, während die Effekte auf Sicherheit, Effizienz und klinische Endpunkte weniger konsistent waren [21]. Entscheidungsunterstützung sollte so gestaltet werden, dass sie in den Arbeitsablauf passt, außer Kraft gesetzt werden kann, wenn der Patient von der Standardsituation abweicht, und nicht zur Alarmmüdigkeit beiträgt.

Der Wissensstand sollte überprüft werden, wenn:

  • eine neue Behandlung oder diagnostische Methode eingeführt wird
  • neue Sicherheitssignale auftreten
  • eine wichtige randomisierte Studie publiziert wird
  • eine systematische Übersichtsarbeit oder Leitlinie aktualisiert wird
  • sich das Basisrisiko oder die Ziele des Patienten ändern
  • die Intervention nicht die erwartete Wirkung zeigt
  • die Behandlungslast den Nutzen übersteigt

Eine funktionierende evidenzbasierte Kultur erfordert daher sowohl individuelle Fertigkeiten als auch organisatorische Systeme für Suche, kritische Bewertung, partizipative Entscheidungsfindung, Nachverfolgung und den Abbau ineffektiver Arbeitsweisen.

Quellen

  1. Sackett DL et al. Evidence based medicine: what it is and what it isn't. BMJ 1996. PMID: 8555924
  2. Kumaravel B et al. A systematic review and taxonomy of tools for evaluating evidence-based medicine teaching in medical education. Systematic Reviews 2020. PMID: 32331530
  3. Grant MJ, Booth A. A typology of reviews: an analysis of 14 review types and associated methodologies. Health Information and Libraries Journal 2009. PMID: 19490148
  4. Arents BWM et al. Global Guidelines in Dermatology Mapping Project, a systematic review of atopic dermatitis clinical practice guidelines: are they clear, unbiased, trustworthy and evidence based? British Journal of Dermatology 2022. PMID: 34984668
  5. Guyatt G et al. GRADE guidelines: 1. Introduction, GRADE evidence profiles and summary of findings tables. Journal of Clinical Epidemiology 2011. PMID: 21195583
  6. Page MJ et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 2021. PMID: 33782057
  7. Shea BJ et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ 2017. PMID: 28935701
  8. Schulz KF et al. CONSORT 2010 statement: updated guidelines for reporting parallel group randomised trials. BMJ 2010. PMID: 20332509
  9. von Elm E et al. The Strengthening the Reporting of Observational Studies in Epidemiology statement: guidelines for reporting observational studies. Journal of Clinical Epidemiology 2008. PMID: 18313558
  10. Bossuyt PM et al. STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ 2015. PMID: 26511519
  11. Collins GS et al. Transparent reporting of a multivariable prediction model for individual prognosis or diagnosis: the TRIPOD statement. BMJ 2015. PMID: 25569120
  12. Hammer GP et al. Avoiding bias in observational studies: part 8 in a series of articles on evaluation of scientific publications. Deutsches Ärzteblatt International 2009. PMID: 19946431
  13. Prada-Ramallal G et al. Bias in pharmacoepidemiologic studies using secondary health care databases: a scoping review. BMC Medical Research Methodology 2019. PMID: 30871502
  14. Liau MYQ et al. Can propensity score matching replace randomized controlled trials? World Journal of Methodology 2024. PMID: 38577204
  15. Kallner A. Bayes' theorem, the ROC diagram and reference values: definition and use in clinical diagnosis. Biochemia Medica 2018. PMID: 29209139
  16. Christofilos SI et al. Network meta-analyses: methodological prerequisites and clinical usefulness. World Journal of Methodology 2022. PMID: 35721244
  17. Draak THP et al. The minimum clinically important difference: which direction to take. European Journal of Neurology 2019. PMID: 30793428
  18. Ilic D et al. Prostate cancer screening with prostate-specific antigen test: a systematic review and meta-analysis. BMJ 2018. PMID: 30185521
  19. Stacey D et al. Decision aids for people facing health treatment or screening decisions. Cochrane Database of Systematic Reviews 2024. PMID: 38284415
  20. Forsetlund L et al. Continuing education meetings and workshops: effects on professional practice and healthcare outcomes. Cochrane Database of Systematic Reviews 2021. PMID: 34523128
  21. Nguyen OT et al. Electronic health record nudges and health care quality and outcomes in primary care: a systematic review. JAMA Network Open 2024. PMID: 39287947

Aktualisiert 15. September 2026