
Evidence Lab
Wie man eine wissenschaftliche Studie liest
Im Median melden 31 Prozent der Studien einen anderen Hauptendpunkt als registriert. So prüfen Sie IMRaD, Vorregistrierung, Spin und CONSORT in zehn M
ARArtunabhängigAbelastbar Freier Zugang
MEMehrere ArtenBmoderatT1nur Hypothese
Ein Biomarker ersetzt einen klinischen Endpunkt erst nach Validierung: Prüfregeln, biologische Variation, Referenzintervalle, bekannte Fehlschläge.

Zusammenfassung
Ein Biomarker misst einen Zwischenzustand, ein klinischer Endpunkt misst, wie es einem Lebewesen tatsächlich ergeht. Ein Marker darf einen Endpunkt nur ersetzen, wenn nachgewiesen ist, dass der Behandlungseffekt auf den Marker den Effekt auf den Endpunkt vorhersagt. Diese Prüfung fällt oft negativ aus: In einer Übersicht von 78 Validierungsarbeiten aus der Krebsmedizin zeigte nur rund jede achte Konstellation einen durchgehend starken Zusammenhang.
Das Wesentliche
Ein klinischer Endpunkt beschreibt, wie es einem Patienten oder einem Tier tatsächlich ergeht: eine Fraktur, eine Kolikoperation, ein Todesfall, eine wiedergewonnene Bewegungsfreiheit. Ein Biomarker ist eine Messgrösse, die diesen Zustand nur indirekt abbildet: Blutzucker, Knochendichte, Serum-Amyloid A. Ein Surrogatendpunkt ist ein Biomarker mit einem zusätzlichen, viel stärkeren Anspruch. Er soll den Behandlungseffekt auf den klinischen Endpunkt ersetzen und nicht bloss begleiten.
Diese Unterscheidung ist keine Wortklauberei. Eine internationale Arbeitsgruppe, die 2023 die Berichtsstandards für Studien mit Surrogatendpunkten erarbeitete, prüfte die gebräuchlichen Definitionen und fand sie widersprüchlich und unklar. Dieselbe Messgrösse wurde von Fachpersonen, Zulassungsbehörden und Betroffenen unterschiedlich eingeordnet: Was die einen als blosses Zwischenergebnis lasen, galt den anderen bereits als Ziel der Behandlung.
Nein: Surrogat ist eine Rolle, keine Eigenschaft der Messgrösse selbst. Derselbe Wert kann als Diagnosehilfe, als Verlaufskontrolle oder als Ersatzziel einer ganzen Studie dienen, und die verlangte Beweislast steigt mit jeder dieser Stufen erheblich an, bis zuletzt der Nachweis eines übertragbaren Behandlungseffekts gefordert ist. Die Frage „liegt hier eine Entzündung vor?“ verlangt völlig andere Belege als die Frage „senkt diese Behandlung die Sterblichkeit?“.
Die klassische Prüfregel verlangt drei Dinge gleichzeitig: Der Marker muss mit dem klinischen Endpunkt zusammenhängen, die Behandlung muss den Marker verändern, und der gesamte Effekt der Behandlung auf den Endpunkt muss über den Marker verlaufen. Die dritte Bedingung ist die schwierigste, weil sie sich nie direkt beobachten lässt. Eine methodische Übersicht von 2024 kam zum Schluss, dass der oft zitierte „erklärte Anteil des Behandlungseffekts“ nur dann eine sinnvolle Bedeutung hat, wenn man sehr starke und grundsätzlich nicht überprüfbare Annahmen akzeptiert.
Deshalb wird heute auf Studienebene geprüft. Man trägt über viele randomisierte Studien hinweg den Effekt auf den Marker gegen den Effekt auf den Endpunkt ab und misst, wie viel der Unterschiede zwischen den Studien dabei erklärt wird. Für die Knochendichte hat diese Prüfung funktioniert: Eine gepoolte Auswertung der Einzeldaten von 91'779 Teilnehmenden aus 23 placebokontrollierten Osteoporosestudien fand, dass Veränderungen der Hüftknochendichte 44 bis 67 Prozent des Behandlungseffekts auf das Frakturrisiko erklärten.
Eine Anschlussarbeit an 61'415 Teilnehmenden aus 16 Studien bestimmte zusätzlich die Mindestwirkung, ab der eine Frakturreduktion praktisch sicher wird: rund 1,4 Prozent Dichtezunahme an der Hüfte für Wirbelbrüche und rund 3,2 Prozent für Hüftbrüche über 24 Monate. Eine solche Schwelle ist der eigentliche Gewinn einer Validierung. Ohne sie bleibt der Satz „der Marker hat sich verbessert“ eine Aussage ohne Massstab.
Der bekannteste Gegenbeweis stammt aus der Kardiologie. Nach einem Herzinfarkt gelten gehäufte Extraschläge des Herzens als Warnzeichen, und zwei Wirkstoffe unterdrückten sie zuverlässig. In der randomisierten Prüfung an 1'498 Personen starben in den Wirkstoffgruppen 43 Personen an Rhythmusstörungen, unter Placebo 16. Der Marker besserte sich wie erwartet, das Überleben verschlechterte sich.
Rund zwanzig Jahre später wiederholte sich das Muster im Fettstoffwechsel. Ein Hemmstoff des Cholesterintransfers hob das HDL-Cholesterin nach zwölf Monaten um 72,1 Prozent und senkte das LDL-Cholesterin um 24,9 Prozent: ein Lipidprofil wie aus dem Lehrbuch. Die Studie an 15'067 Personen mit hohem Herz-Kreislauf-Risiko wurde dennoch vorzeitig abgebrochen, weil unter dem Wirkstoff mehr Herz-Kreislauf-Ereignisse auftraten und die Gesamtsterblichkeit rund anderthalbmal so hoch lag.
Beide Fälle zeigen dasselbe Prinzip: Ein Wirkstoff greift selten nur in einen Pfad ein. Der Marker erfasst den erwünschten Pfad, der Schaden läuft über einen anderen. In der Statistik heisst diese Konstellation Surrogat-Paradox: Der Marker hängt mit dem Endpunkt zusammen, die Behandlung bewegt den Marker in die richtige Richtung, und trotzdem schadet sie unter dem Strich.
Das sind keine Einzelfälle. Eine Übersicht über 78 Validierungsarbeiten aus der Krebsmedizin, die zusammen 89 Konstellationen abdeckten, fand nur in 11 Konstellationen durchgehend starke Zusammenhänge mit dem Gesamtüberleben und in 34 ausschliesslich schwache. In 35 weiteren hing das Ergebnis davon ab, welcher Marker und welches Rechenverfahren gewählt wurde. Bei nicht operablem Leberkrebs unter Immuntherapie fand eine Auswertung von 2024 nur einen schwachen Zusammenhang zwischen progressionsfreiem Überleben und Gesamtüberleben, während vollständige Rückbildungen des Tumors eng mit dem Überleben zusammenhingen.
In der Herzinsuffizienz fiel die Bilanz ähnlich aus. Eine systematische Auswertung von 96 randomisierten Studien mit zusammen 120'304 Patientinnen und Patienten fand, dass behandlungsbedingte Änderungen der natriuretischen Peptide nur 12 Prozent der Unterschiede in der Gesamtsterblichkeit zwischen den Studien erklärten. Die Auswurffraktion des Herzens schnitt besser ab: mässig für die Sterblichkeit, stark für Spitaleintritte wegen Herzinsuffizienz, und dies nur bei Personen mit reduzierter Pumpfunktion.
Auch die Behördenseite ist zurückhaltender, als der Alltag vermuten lässt: Eine Durchsicht von 15 Surrogatanalysen der US-Arzneimittelbehörde aus den Jahren 2005 bis 2022 fand genau eine, die einen starken Zusammenhang mit dem Gesamtüberleben belegte. Und die Schwäche betrifft nicht nur die Krebsmedizin. Eine systematische Übersicht zur Kariesvorbeugung wertete 51 Studien zu Fissurenversiegelungen und vier zu fluoridhaltigen Zahnpasten aus und fand für keinen der geprüften Ersatzmarker eine ausreichende Validierungsgrundlage.
Bevor man fragt, ob ein Marker das richtige Ziel misst, muss man wissen, wie stark er von selbst schwankt. Jeder Messwert pendelt um einen individuellen Sollwert. Beschrieben wird das durch die Schwankung innerhalb eines Individuums, die Schwankung zwischen Individuen und die Messunsicherheit des Labors. Aus diesen drei Grössen ergibt sich, wie gross ein Unterschied zwischen zwei Messungen mindestens sein muss, damit er keine Zufallsschwankung ist. Eine systematische Übersicht von 2025 zählt dafür fünf praktische Anwendungen auf, darunter diesen Referenzänderungswert und persönliche statt bevölkerungsbezogene Referenzintervalle.
Ein Beispiel aus der Humanmedizin macht das greifbar. Bei 38 gesunden Erwachsenen, die zehn Wochen lang wöchentlich untersucht wurden, schwankte der Langzeitblutzucker innerhalb einer Person um 2,9 Prozent, zwischen Personen dagegen um 7,9 Prozent. Weil die persönliche Schwankung so viel kleiner ist als die Streuung in der Bevölkerung, sagt der eigene Verlauf mehr aus als der Vergleich mit dem Referenzintervall. Für die Mastzell-Tryptase ergab eine gleichartige Untersuchung an 14 Erwachsenen, dass ein Anstieg von weniger als rund 24 Prozent nicht zuverlässig von Zufall zu unterscheiden ist.
Dazu kommt die Messunsicherheit des Verfahrens selbst. Ein stallseitiger Schnelltest für Serum-Amyloid A beim Pferd erreichte innerhalb einer Testcharge Streuungen von 13 bis 18 Prozent, zwischen Chargen jedoch bis zu 45 Prozent im hohen Konzentrationsbereich. Eine scheinbare Verdopplung des Messwerts kann damit allein aus dem Wechsel der Charge entstehen. Wer einen Verlauf beurteilen will, misst mit demselben Verfahren, derselben Charge und demselben Probenmaterial.
Für eine Momentaufnahme genügt er, für eine Verlaufsaussage nicht. Ein einzelner Messwert trennt nicht zwischen echter Veränderung, normaler Tagesschwankung und dem Rauschen des Verfahrens, weil ihm der Vergleichspunkt fehlt und weil die bekannte Eigenschwankung des Markers dabei völlig unberücksichtigt bleibt. Zwei Messungen unter gleichen Bedingungen zeigen, ob sich etwas bewegt hat. Erst der Vergleich mit der Eigenschwankung sagt, ob die Bewegung zählt.
Ein Referenzintervall ist keine Grenze zwischen gesund und krank. Es ist die Spanne, in die die mittleren 95 Prozent einer als gesund definierten Referenzgruppe fallen. Damit liegt jedes zwanzigste gesunde Individuum per Konstruktion ausserhalb. Werden zwanzig Analyte gleichzeitig bestimmt, beträgt die Wahrscheinlichkeit, dass alle innerhalb liegen, nur noch rund 36 von 100. Ein einzelner auffälliger Wert in einem grossen Profil ist der Normalfall und nicht der Alarm.
Die veterinärmedizinischen Leitlinien zur Erstellung von Referenzintervallen folgen bewusst denselben Regeln wie die humanmedizinischen: definierte Referenzpopulation, dokumentierter Umgang mit Ausreissern, Aufteilung nach Alter, Geschlecht oder Rasse nur dann, wenn die Daten sie rechtfertigen. Sie halten ausserdem fest, dass übernommene Intervalle aus fremden Quellen vor dem Gebrauch am eigenen Material geprüft werden müssen, und dass ein Entscheidungsgrenzwert etwas anderes ist als ein Referenzintervall.
Wie stark ein Intervall an Verfahren und Population klebt, zeigt ein Beispiel von 2026: Für 176 klinisch gesunde Esel ergab ein eselspezifischer Test ein Referenzintervall für Serum-Amyloid A von 2,91 bis 42,85 Nanogramm pro Milliliter, wobei die obere Grenze ausdrücklich unsicher blieb. Beim Pferd wiederum lag dieselbe Substanz in 94 Prozent der Serumproben von 62 gesunden Tieren unterhalb der Nachweisgrenze des dort verwendeten Verfahrens. Die beiden Zahlen lassen sich nicht nebeneinanderlegen: Sie stammen aus verschiedenen Testsystemen und werden in verschiedenen Einheiten angegeben. „Normal“ heisst beim Pferd schlicht: nicht messbar.
Der Kontext verschiebt die Grenze zusätzlich. Bei Traberrennpferden stieg das kardiale Troponin nach dem Rennen im Median um 1,36 Nanogramm pro Liter an, ohne dass daraus eine Erkrankung folgte; die zugehörige Untersuchung bestimmte den oberen Referenzpunkt an Blutproben vor dem Start. Ein Wert, der zwei Stunden nach einem Rennen erhoben wird, ist nicht derselbe Wert wie am Ruhetag.
Zwischen den Arten reist das Denkgerüst, nicht die Zahl. Die veterinärmedizinischen Regeln für Referenzintervalle sind an den humanmedizinischen Standard angelehnt, weil die zugrunde liegende Statistik artunabhängig ist. Die Werte selbst sind es nie: Sie hängen von Physiologie, Haltung, Fütterung, Testverfahren und Referenzpopulation ab, und schon der Wechsel vom Pferd zum Esel verändert das Ergebnis.
Ein equines Beispiel zeigt, wie weit ein guter Risikomarker von einem validierten Surrogat entfernt bleibt. In einer prospektiven Kohorte mit 317 Fällen akuter Hufrehe, von denen 276 endokrin bedingte Fälle über zwei Jahre verfolgt wurden, trat bei 34,1 Prozent ein Rückfall auf, und das Rückfallrisiko stieg mit der Nüchtern-Insulinkonzentration. Das ist eine Assoziation. Es ist kein Nachweis, dass ein Absenken des Insulinwerts die Rückfälle verhindert.
Wie beweglich solche Marker sind, zeigt eine Längsschnittstudie mit 1'763 Zuckerbelastungstests an 367 Ponys: Der Insulinwert nach 60 Minuten hing von Alter, Körperkondition, Rasse, Jahreszeit und weiteren Faktoren ab, und die von Halterinnen und Haltern beobachtbaren Merkmale erklärten nur einen kleinen Teil der Unterschiede. Ein Grenzwert, der in einer Region und einer Jahreszeit trennt, tut es anderswo womöglich nicht.
Ein grosser Teil der Fehlinterpretationen im Alltag geht auf wenige, immer gleiche Denkfehler zurück. Sie betreffen Fachleute wie Laien und lassen sich benennen.
Sie betreffen Zweck, Herkunft, Streuung, Bedingungen, Validierung und Konsequenz. Wer diese sechs Punkte der Reihe nach beantwortet, erkennt meist schon vor der zweiten Messung, ob der Wert eine Handlung begründet oder nur ein Rauschen ist, das man beobachten und in Ruhe wiederholen sollte.
Ein Marker beantwortet immer nur die Frage, für die er geprüft wurde.
Merksatz dieser Seite
Eigene Auswertung
| Feld und Marker | Klinisches Ziel | Erklärter Anteil auf Studienebene | Praktische Lesart |
|---|---|---|---|
| Krebsmedizin: progressionsfreies Überleben unter Immuntherapie plus Chemotherapie | Gesamtüberleben | rund 74 Prozent | brauchbar, aber nur in dieser Therapiekonstellation |
| Krebsmedizin: progressionsfreies Überleben unter Immuntherapie allein | Gesamtüberleben | rund 58 Prozent | mässig, Einzelstudien bleiben unsicher |
| Krebsmedizin: Marker unter Immuntherapie in weiteren Kombinationen | Gesamtüberleben | 1 bis 22 Prozent | als Ersatzziel unbrauchbar |
| Gallenwegskrebs: progressionsfreies Überleben | Gesamtüberleben | rund 71 Prozent | moderat, mit breiter Unsicherheit |
| Gallenwegskrebs: Ansprechrate des Tumors | Gesamtüberleben | rund 1 Prozent | kein Zusammenhang auf Studienebene |
| Herzinsuffizienz: natriuretische Peptide | Gesamtsterblichkeit | rund 12 Prozent | als Ersatzziel unbrauchbar |
| Herzinsuffizienz: Auswurffraktion bei reduzierter Pumpfunktion | Spitaleintritte wegen Herzinsuffizienz | rund 90 Prozent | stark, aber nur in dieser Untergruppe |
| Multiples Myelom: messbare Resterkrankung | progressionsfreies Überleben | rund 97 Prozent | stark, doch das Ziel ist selbst ein Ersatzziel |
| Osteoporose: Knochendichte an der Hüfte | Frakturen | 44 bis 67 Prozent des Behandlungseffekts | validiert, mit definierter Mindestwirkung |
Meistens nicht, und das ist rechnerisch begründet. Ein Referenzintervall umfasst die mittleren 95 Prozent einer gesunden Referenzgruppe, also liegt jedes zwanzigste gesunde Individuum ausserhalb, ohne dass etwas fehlt. Bei zwanzig gleichzeitig bestimmten Werten ist mindestens ein auffälliger Befund der Regelfall. Aussagekräftig wird ein Wert erst durch den Zusammenhang: Wie weit liegt er ausserhalb, passt er zum übrigen Bild, und bewegt er sich bei einer zweiten Messung unter gleichen Bedingungen weiter? Die Einordnung eines konkreten Befundes gehört in ärztliche oder tierärztliche Hände.
Weil ein Messwert immer an sein Verfahren gebunden ist. Verschiedene Testsysteme messen unterschiedliche Anteile derselben Substanz und werden gegen unterschiedliche Bezugsmaterialien geeicht. Beim Serum-Amyloid A des Pferdes empfahlen die Autoren einer Validierungsstudie ausdrücklich, Ergebnisse eines stallseitigen Schnelltests nicht mit denen eines Laborverfahrens zu vergleichen. Zwischen Testchargen desselben Schnelltests traten im hohen Bereich Streuungen bis 45 Prozent auf. Verläufe sind deshalb nur innerhalb desselben Verfahrens, möglichst derselben Charge und desselben Probenmaterials aussagekräftig.
Nicht automatisch, und diese Lücke ist der Kern des Themas. Ein Wirkstoff greift meist in mehrere Pfade ein: Der Marker erfasst den erwünschten, der Schaden kann über einen anderen laufen. Zwei grosse randomisierte Studien haben das gezeigt: Herzrhythmus-Extraschläge verschwanden und die Sterblichkeit stieg; das HDL-Cholesterin stieg um 72 Prozent und die Studie musste wegen Übersterblichkeit abgebrochen werden. Erst eine Prüfung über viele Studien hinweg zeigt, ob die Markerbewegung den klinischen Nutzen zuverlässig vorhersagt.
Ein Referenzintervall beschreibt, was bei Gesunden vorkommt. Ein Entscheidungsgrenzwert wird dagegen so gewählt, dass er zwei Gruppen möglichst gut trennt, etwa erkrankt und nicht erkrankt, oder erhöhtes und normales Risiko. Die veterinärmedizinischen Leitlinien halten beide Begriffe strikt auseinander, weil sie unterschiedlich hergeleitet werden und Unterschiedliches leisten. Ein Wert kann innerhalb des Referenzintervalls liegen und trotzdem oberhalb eines Entscheidungsgrenzwerts, und umgekehrt.
Nein, und das lässt sich beziffern. Eine Untersuchung an 176 klinisch gesunden Eseln bestimmte 2026 ein eigenes Referenzintervall für Serum-Amyloid A mit einem eselspezifischen Testverfahren, weil kein allgemein akzeptiertes Intervall existierte. Schon zwischen Studien an Eseln fielen die Ergebnisse unterschiedlich aus, was die Autoren auf Testsystem, Gruppengrösse, Haltung und Zusammensetzung der untersuchten Tiere zurückführen. Wenn bereits zwei nah verwandte Equidenarten getrennte Intervalle brauchen, ist der Sprung vom Tier zum Menschen erst recht nicht zulässig.
Mindestens zwei unter vergleichbaren Bedingungen, und der Abstand zwischen ihnen muss grösser sein als die bekannte Eigenschwankung des Markers. Für die Mastzell-Tryptase des Menschen etwa gilt eine Änderung von weniger als rund 24 Prozent als nicht sicher unterscheidbar vom Zufall. Für die meisten equinen Marker fehlen solche Kennzahlen bisher, weshalb dort der klinische Zusammenhang die Hauptlast trägt. Gleiche Tageszeit, gleiche Belastungssituation, gleiches Probenmaterial und dasselbe Verfahren sind in jedem Fall Voraussetzung.
Begriffe in diesem Text

Evidence Lab
Im Median melden 31 Prozent der Studien einen anderen Hauptendpunkt als registriert. So prüfen Sie IMRaD, Vorregistrierung, Spin und CONSORT in zehn M
ARArtunabhängigAbelastbar Freier Zugang

Evidence Lab
Nur rund 5 Prozent der im Tier geprüften Therapien erhalten eine Zulassung. Was Tierstudien über Menschen und Pferde aussagen, und was nicht: die Bele
MEMehrere ArtenBmoderatT1nur Hypothese Freier Zugang

Evidence Lab
Störfaktoren, umgekehrte Kausalität, Kollider- und Publikationsverzerrung: was methodische Übersichten dazu sagen, wann ein Zusammenhang Ursache ist.
ARArtunabhängigBmoderat Freier Zugang
Einmal im Monat: neue Synthesen, geprüfte Studien und was sich an der Beweislage geändert hat.