Altern – Proteomische Uhren und das Surrogatparadox
Einleitung
Altern ist kein einheitlicher Prozess. Organe, Zelltypen und molekulare Systeme verändern sich mit unterschiedlicher Geschwindigkeit. Proteomische Uhren versuchen, aus Konzentrationsmustern vieler Proteine ein biologisch interpretierbares Alter, eine altersbezogene Abweichung oder ein Risiko abzuleiten. Besonders anspruchsvoll sind organspezifische Proteomuhren: Sie sollen aus Blutproteinen beispielsweise Aussagen über Gehirn, Herz, Leber, Niere, Lunge, Gefäßsystem, Muskel oder Immunsystem ermöglichen.

Für Forschung und klinische Translation ist jedoch eine zentrale Unterscheidung unverzichtbar: Eine Uhr kann das chronologische Alter gut vorhersagen, ohne zukünftige Erkrankungen besonders gut zu prognostizieren. Sie kann Erkrankungsrisiken prognostizieren, ohne zu zeigen, dass eine Intervention, die den Uhrenwert verbessert, tatsächlich Gesundheit oder Funktion verbessert. Und selbst ein Biomarker, der stark mit einem klinischen Endpunkt korreliert, ist noch kein validiertes Interventionssurrogat. Genau an dieser Stelle entsteht das Surrogatparadox: Eine Intervention kann einen Biomarker in die vermeintlich günstige Richtung verändern, während sich der patientenrelevante Endpunkt verschlechtert.
Dieser aiMOOC richtet sich an ein fortgeschrittenes Professorenkolleg, an Forschende der Biogerontologie, Proteomik, Epidemiologie, Biostatistik und Klinische Forschung. Du auditierst aktuelle organspezifische Proteomuhren auf Leakage, Zellmischung, Kohortentransport und konkurrierende Risiken. Anschließend entwirfst Du eine externe Validierungsstrategie, die Alterskalibration, funktionelle Endpunkte, Risiko-Kalibration und vorab definierte Ablehnungskriterien verbindet.
Proteomische Uhren: Was wird eigentlich vorhergesagt?
Eine Proteomuhr ist zunächst nur eine mathematische Funktion. Aus einem Proteinvektor wird eine Zielgröße geschätzt:
.
Die wissenschaftliche Bedeutung hängt vollständig davon ab, welches gewählt wurde und in welchem Kontext das Modell geprüft wird.
Altersvorhersage
Bei einer Altersuhr ist das Ziel das chronologische Alter. Das Modell wird darauf trainiert, aus Proteinkonzentrationen das Kalenderalter zu rekonstruieren. Wichtige Kennzahlen sind MAE, RMSE, Korrelation und Kalibration.
Eine hohe Korrelation zwischen vorhergesagtem und chronologischem Alter beantwortet die Frage:
Wie gut bildet das Proteom altersabhängige Unterschiede in dieser Population ab?
Sie beantwortet nicht automatisch:
Wie krank ist eine Person?
und erst recht nicht:
Wird eine Therapie nützen, wenn sie diesen Wert senkt?
Der häufig verwendete Age Gap ist eine Abweichung zwischen vorhergesagtem und erwartbarem proteomischem Alter bei gegebenem chronologischem Alter. Formal kann er als Residuum einer Regressionsfunktion geschrieben werden:
.
Das Residuum ist jedoch keine direkt beobachtbare biologische Größe. Seine Interpretation hängt von Referenzpopulation, Modellform, Kalibrationsverfahren und technischer Plattform ab.
Risikoprognose
Eine prognostische Uhr wird daran gemessen, ob sie zukünftige Ereignisse vorhersagt, beispielsweise Demenz, Herzinsuffizienz, chronische Nierenerkrankung, Multimorbidität oder Mortalität. Hier sind andere Kennzahlen entscheidend:
- Diskrimination: Trennt das Modell Personen mit späterem Ereignis von Personen ohne Ereignis?
- Kalibration: Stimmen vorhergesagte und beobachtete absolute Risiken überein?
- Zeitabhängiger Brier-Score: Wie groß ist der Prognosefehler zu definierten Zeitpunkten?
- Nettonutzen: Verbessert die Uhr Entscheidungen gegenüber einem klinischen Basismodell?
- Konkurrierende Risiken: Wird berücksichtigt, dass Tod das spätere Auftreten anderer Endpunkte verhindern kann?
Eine Uhr kann eine signifikante Hazard Ratio besitzen und trotzdem schlecht kalibriert sein. Eine hohe AUC oder ein hoher C-Index genügt daher nicht für klinische Risikoprognose.
Interventionssurrogat
Ein validiertes Surrogat soll nicht nur Personen mit unterschiedlichem Risiko unterscheiden. Es soll ermöglichen, aus dem Behandlungseffekt auf den Surrogatmarker auf den Behandlungseffekt auf einen patientenrelevanten Endpunkt zu schließen.
Nach der FDA-BEST-Systematik ist ein Biomarker eine objektiv gemessene biologische Eigenschaft; er ist gerade nicht identisch mit dem Befinden, der Funktion oder dem Überleben einer Person.[4]
Für eine Intervention , einen Surrogatmarker und einen klinischen Endpunkt interessiert deshalb nicht nur:
,
sondern vor allem die Beziehung zwischen:
und .
Eine Surrogatvalidierung verlangt Evidenz über mehrere randomisierte Interventionen oder Studien hinweg. Der aktuelle methodische Rahmen betont insbesondere die Beziehung zwischen Behandlungseffekten auf Surrogat und Zielendpunkt, die individuelle Surrogat-Endpunkt-Assoziation sowie biologische Plausibilität.[5]
Merksatz: Altersvorhersage ist keine Risikoprognose. Risikoprognose ist keine Surrogatvalidierung.
Zwei aktuelle organspezifische Proteomuhren
SomaScan-basierte Organuhr von Oh und Kolleginnen und Kollegen
Die 2023 in Nature publizierte Arbeit von Oh et al. entwickelte organspezifische Plasma-Proteomuhren für elf große Organe bzw. Organsysteme. Ausgangspunkt waren Proteine, deren kodierende Gene anhand von GTEx-Gewebeexpressionsdaten als organangereichert klassifiziert wurden. Die Studie analysierte nach Qualitätskontrolle 4.778 mit SomaScan gemessene Proteinziele, darunter 856 organangereicherte Proteine, und validierte Alterssignaturen in fünf Kohorten mit insgesamt 5.676 Erwachsenen.[1]
Die Modelle wurden als Ensembles von LASSO-Altersmodellen aufgebaut. Der Age Gap wurde innerhalb jeder Kohorte aus einer nichtlinearen LOWESS-Beziehung zwischen vorhergesagtem und chronologischem Alter abgeleitet und anschließend standardisiert.[1]
Stärke: Die Arbeit etablierte ein anschauliches und reproduzierbares Konzept heterogener Organalterung.
Auditfrage: Wenn Age Gaps kohortenspezifisch mit Alter und Standardabweichung neu zentriert werden, ist die resultierende Größe dann wirklich ein vollständig eingefrorener, unmittelbar transportierbarer Individualscore?
Olink-basierte Organuhr von Wang und Kolleginnen und Kollegen
Eine neuere Arbeit entwickelte organismische und zehn organspezifische Uhren in 43.616 Teilnehmenden der UK Biobank und validierte sie in 3.977 Teilnehmenden der China Kadoorie Biobank und 800 Teilnehmenden der US-amerikanischen Nurses’ Health Study. Gemessen wurden 2.916 Proteine mit Olink Explore 3072; 418 wurden über GTEx als organangereichert annotiert.[2]
Die UK-Biobank-Daten wurden in Trainings- und Testdaten im Verhältnis 70:30 geteilt. LightGBM und Boruta wurden für Modellierung und Merkmalsauswahl verwendet. Das organismische Modell enthielt 240 altersbezogene Proteine; organspezifische Modelle reichten von wenigen Proteinen bis zu größeren Panels. Die Autoren berichteten eine starke organismische Alterskorrelation und konsistente Modellleistung in den externen Kohorten.[2]
Die Studie untersuchte außerdem Erkrankungsinzidenz, kognitive Endpunkte, Mortalität und genetische beziehungsweise umweltbezogene Determinanten. Für Ereignisanalysen wurden Cox-Modelle verwendet. Bei Erkrankungsendpunkten endete die Nachbeobachtung am frühesten Zeitpunkt von Diagnose, Tod oder Ende der Nachbeobachtung.[2]
Stärke: große Trainingskohorte, unabhängige Kohorten in China und den USA und eine zweite Proteomplattform gegenüber der früheren SomaScan-Arbeit.
Auditfrage: Externe Validierung auf derselben Olink-Plattform testet geographischen und teilweise demographischen Transport, aber nicht automatisch den Transport über andere Assays, extrem alte Menschen, akut Kranke oder populationsweit unterschiedliche Zell- und Krankheitsmischungen.
Nicht organspezifische Proteomuhren als Kontrollgruppe
Die 2024 publizierte Nature-Medicine-Arbeit von Argentieri et al. trainierte eine allgemeine Proteomuhr in der UK Biobank mit 2.897 Olink-Proteinen und 45.441 Teilnehmenden. Ein Modell mit 204 Proteinen erreichte eine hohe Alterskorrelation und wurde in China und Finnland extern validiert.[3]
Diese Arbeit ist methodisch wichtig, weil sie verdeutlicht, dass eine hohe Altersvorhersagegüte auch ohne organspezifische Zuschreibung erreichbar ist. Eine zentrale Auditfrage lautet deshalb immer:
Erklärt eine Organuhr wirklich organintrinsische Alterung oder überwiegend systemisches Altern plus organassoziierte Proteinquellen?
Audit 1: Leakage
Leakage bedeutet, dass Informationen aus Test-, Ziel- oder Zukunftsdaten in Modellierung, Normalisierung, Merkmalsauswahl oder Kalibration einfließen und dadurch die scheinbare Generalisierbarkeit überschätzt wird.
Klassische Zielvariablen-Leakage
Direkte Leakage wäre gegeben, wenn Informationen über das chronologische Alter oder den späteren klinischen Endpunkt über versteckte Variablen in die Proteinmerkmale eingehen. Beispiele sind:
- Platteneffekt: Ältere und jüngere Personen liegen systematisch auf unterschiedlichen Messplatten.
- Rekrutierungszentrum: Zentrum, Alter und Präanalytik sind gekoppelt.
- Lagerungsdauer: ältere Proben stammen überwiegend aus früheren Rekrutierungsjahren.
- Batch-Normalisierung: Testdaten werden zur Definition der Verteilung genutzt.
- Merkmalsauswahl: Feature Selection wird vor Cross-Validation auf dem Gesamtdatensatz durchgeführt.
Ein korrekter Audit verlangt, dass sämtliche datengetriebenen Schritte innerhalb der Trainingsfalten stattfinden und auf externe Daten nur eingefrorene Transformationen angewandt werden.
Age-Gap-Leakage und transduktive Rekalibration
Besonders subtil ist die kohortenspezifische Residualisierung. Wenn eine externe Kohorte zunächst vollständig genutzt wird, um eine LOWESS-Kurve oder eine z-Standardisierung zu schätzen, fließt die Altersverteilung der späteren Anwendungspopulation in den Score ein.
Das ist nicht dieselbe Form von Leakage wie eine direkte Nutzung des klinischen Endpunkts. Für einen echten Individualtest ist es aber transduktiv: Das Ergebnis einer einzelnen Person hängt von der Zusammensetzung der Kohorte ab, in der sie gemessen wurde.
Ein strenger externer Validierungstest verwendet deshalb:
- eingefrorene Proteintransformationen,
- eingefrorene Regressionskoeffizienten oder Bäume,
- eingefrorene Age-Gap-Transformationen,
- keine Neuschätzung der Referenzkurve in der Testkohorte.
Eine nachträgliche Rekalibration darf zusätzlich untersucht werden, muss aber separat als Rekalibrationsanalyse bezeichnet werden.
Outcome-Leakage in Risikomodellen
Wenn eine Altersuhr zunächst ohne klinische Endpunkte trainiert wurde und erst danach prospektiv mit Erkrankungen assoziiert wird, besteht keine direkte Outcome-Leakage aus den Ereignislabels. Trotzdem bleiben zwei Probleme:
Prävalente Erkrankungen: Bereits bestehende Krankheiten können Proteinkonzentrationen verändern. Ein Score, der später Krankheit vorhersagt, kann teilweise bereits subklinische oder manifeste Krankheit messen.
Selektive Modellentwicklung: Wenn nach Sichtung vieler Endpunkte genau diejenige Uhr, Transformation oder Schwelle hervorgehoben wird, die besonders gut mit einem Endpunkt assoziiert ist, entsteht Optimismus durch analytische Flexibilität.
Die neuere Olink-Arbeit schloss für jeweilige Inzidenzanalysen Personen mit bereits vorhandenem Zielereignis aus und führte Sensitivitätsanalysen nach Ausschluss weiterer Baseline-Erkrankungen durch.[2] Das reduziert Reverse Causality, beseitigt sie aber nicht vollständig.
Technische Leakage-Tests
Ein Audit sollte mindestens folgende negative Kontrollen enthalten:
- Age-shuffle-Test: Alter permutieren und die komplette Pipeline erneut trainieren.
- Batch-only-Modell: prüfen, wie gut Alter allein aus Platte, Zentrum, Lagerungszeit und Messdatum vorhergesagt werden kann.
- Family-group split: verwandte Personen nicht über Trainings- und Testdaten verteilen.
- Center-held-out split: ganze Rekrutierungszentren als Testdomäne zurückhalten.
- Time-held-out split: spätere Proben als prospektiven Test verwenden.
- Locked preprocessing: Normalisierungskonstanten ausschließlich aus Training oder externen Referenzmaterialien übernehmen.
Audit 2: Zellmischung und Quellenproblem

Plasmaproteomik misst nicht direkt das Proteom eines Organs. Im Blut beobachtete Konzentrationen entstehen aus einem Gemisch von:
- Synthese und Sekretion,
- Zellverlust und Proteinfreisetzung,
- Proteolyse und Shedding,
- Gefäßpermeabilität,
- Verteilung im Extrazellulärraum,
- renaler und hepatischer Clearance,
- Immunzellaktivität,
- Veränderungen der Zellzusammensetzung.
Deshalb ist die Aussage dieses Protein stammt aus dem Gehirn stärker als die tatsächlich belegte Aussage das kodierende Gen ist in GTEx im Gehirn besonders stark exprimiert.
Bulk-Gewebe ist keine Zelltypreinheit
Die Organannotation in den genannten Studien basiert wesentlich auf Bulk-Gewebeexpression aus GTEx.[1][2] Bulk-RNA spiegelt sowohl Genregulation als auch die Mischung der Zelltypen wider.
Ein Protein kann scheinbar organspezifisch sein, weil ein bestimmter Zelltyp in diesem Organ besonders häufig ist. Altern verändert aber selbst Zellanteile, Immuninfiltration, Fibrose, Gefäßdichte und Parenchymverlust. Ein Teil der vermeintlichen Organalterung kann daher ein Kompositionssignal sein.
Beispiel: Nimmt der Anteil entzündlich aktivierter Endothel- oder Immunzellen zu, können entsprechende Plasmaproteine eine ältere Gefäß- oder Immunuhr erzeugen, obwohl nicht gezeigt wurde, dass jede einzelne Zelle biologisch „älter“ geworden ist.
Zellmischungs-Audit
Für jeden organspezifischen Score sollten mindestens vier Analysen durchgeführt werden:
- Single-Cell-Mapping: Zuordnung der Scoreproteine zu Zelltypen in unabhängigen Single-Cell-Atlanten.
- Kompositionsadjustierung: Regression auf Blutbild, Immunzellanteile und verfügbare Zelltypmarker.
- Clearance-Audit: Kontrolle für gemessene Nierenfunktion und hepatische Clearance, da Konzentrationsänderungen ohne veränderte Produktion entstehen können.
- Orthogonale Validierung: Vergleich mit Gewebe, Bildgebung oder physiologischen Messungen, die nicht aus demselben Plasma-Proteom stammen.
Die neuere Olink-Arbeit nutzte Single-Cell-Daten zur biologischen Interpretation einzelner Signalwege.[2] Das ist wertvoll, ersetzt aber keine individuelle Deconvolution des Plasmascores.
Audit 3: Kohortentransport
Transportabilität bedeutet, dass ein Modell außerhalb der Entwicklungspopulation gültig bleibt.
Welche Verschiebungen sind relevant?
Ein Proteomuhr-Modell kann unter folgenden Verteilungsverschiebungen scheitern:
- Altersverschiebung: Training überwiegend im mittleren bis frühen höheren Erwachsenenalter, Anwendung bei Hochaltrigen.
- Krankheitsverschiebung: Bevölkerungskohorte gegenüber Krankenhauspopulation.
- Ethnische und geographische Verschiebung: unterschiedliche genetische, soziale und Umweltkontexte.
- Geschlechtsverschiebung: beispielsweise eine Validierungskohorte ausschließlich mit Frauen.
- Assay-Verschiebung: Olink, SomaScan und Massenspektrometrie messen nicht dieselben Proteine auf identische Weise.
- Präanalytische Verschiebung: Nüchternstatus, Röhrchentyp, Verarbeitung, Lagerung, Freeze-thaw-Zyklen.
- Interventionsverschiebung: Therapie verändert die Proteinmessung oder Proteinverteilung auf eine Weise, die in Beobachtungskohorten nicht vorkommt.
Die 2025er Olink-Arbeit ist hinsichtlich Geographie und Population stärker als eine reine UK-Biobank-Analyse: Sie nutzte UKB, CKB und NHS.[2] Gleichzeitig war die NHS-Validierung auf Frauen beschränkt, die CKB-Proben entstammten einem IHD-Case-Cohort-Design und alle drei Analysen nutzten dieselbe Olink-Plattform. Das ist echte externe Evidenz, aber keine universelle Transportgarantie.
Transport ist mehr als Korrelation
Eine hohe Korrelation von vorhergesagtem und chronologischem Alter kann bei systematischer Fehlkalibration bestehen bleiben.
Beispiel:
kann stark mit dem Alter korrelieren, obwohl junge Personen systematisch zu alt und alte Personen systematisch zu jung geschätzt werden.
Für Transport sind deshalb erforderlich:
- Kalibrationsinterzept,
- Kalibrationssteigung,
- MAE und RMSE nach Altersgruppe,
- Residuen gegen Alter,
- Subgruppenanalysen,
- absolute Risikokalibration für klinische Endpunkte.
Audit 4: Konkurrierende Risiken
Bei älteren Populationen ist Tod häufig ein konkurrierendes Ereignis. Wer stirbt, kann danach keine erstmals diagnostizierte Demenz, Herzinsuffizienz oder andere Erkrankung mehr entwickeln.
In der Olink-Organuhrstudie wurden für inzidente Erkrankungen separate Cox-Modelle verwendet, wobei die Nachbeobachtung bei Diagnose, Tod oder administrativem Ende endete.[2] Das ist für ursachenspezifische Hazard-Fragen verwendbar. Für die Vorhersage der absoluten kumulativen Erkrankungswahrscheinlichkeit reicht es jedoch nicht, Tod wie gewöhnliches nichtinformatives Zensieren zu behandeln.
Ursache-spezifische Hazard versus kumulative Inzidenz
Die cause-specific Hazard beantwortet:
Wie unterscheidet sich die momentane Ereignisrate unter aktuell noch ereignisfreien und lebenden Personen?
Die kumulative Inzidenz beantwortet:
Wie groß ist die reale Wahrscheinlichkeit, bis Zeitpunkt t die Erkrankung zu entwickeln, wenn konkurrierender Tod möglich ist?
Für klinische Prognose sollten deshalb Aalen-Johansen-Schätzer oder entsprechende Competing-Risk-Modelle genutzt und zeitpunktspezifische Risiken kalibriert werden.
Eine Uhr kann paradox erscheinen: Sie kann mit einer hohen ursachenspezifischen Krankheits-Hazard assoziiert sein, aber wegen gleichzeitig noch stärker erhöhter Mortalität eine geringere beobachtete Langzeitinzidenz derselben Krankheit aufweisen. Ohne competing-risk-gerechte Darstellung werden solche Effekte leicht fehlinterpretiert.
Auditmatrix aktueller Proteomuhren
| Dimension | Oh et al. 2023, SomaScan | Wang et al. 2025, Olink | Auditkonsequenz |
|---|---|---|---|
| Altersziel | Chronologisches Alter, organspezifische Proteingruppen | Chronologisches Alter, organismisch und zehn Organsysteme | Gute Altersvorhersage ist nur Ebene 1 der Evidenz |
| Organquelle | GTEx-basierte Organanreicherung, mindestens vierfach höhere Expression | GTEx-basierte Organanreicherung | Bulk-Expression beweist keine eindeutige Plasmaquelle |
| Plattform | SomaScan v4 bzw. v4.1 | Olink Explore 3072 | Assay-spezifische Transportprüfung erforderlich |
| Externe Kohorten | Fünf Kohorten, insgesamt 5.676 Erwachsene | UKB-Entwicklung; CKB und NHS extern | echte externe Evidenz, aber begrenzte Alters-, Krankheits- und Plattformbreite |
| Age Gap | kohortenspezifische LOWESS-Referenz und Standardisierung | Residualisierung gegenüber chronologischem Alter | vollständig eingefrorene Individualanwendung separat testen |
| Zellmischung | Organannotation aus Bulk-Gewebe | Bulk-Annotation plus ergänzende Single-Cell-Interpretation | Zelltypdeconvolution und Clearance-Audit ergänzen |
| Risiko | Assoziationen mit Erkrankungen und Mortalität | prospektive Krankheits- und Mortalitätsanalysen | Diskrimination und Assoziation nicht mit Kalibration verwechseln |
| Competing Risk | Risikoassoziationen, aber keine Surrogatvalidierung | separate Cox-Modelle; Tod beendet Erkrankungsfollow-up | kumulative Inzidenz unter konkurrierendem Tod zusätzlich modellieren |
| Intervention | keine Validierung als Interventionssurrogat | keine Validierung als Interventionssurrogat | Surrogatstatus bleibt offen |
Das Surrogatparadox
Das Surrogatparadox liegt vor, wenn der Behandlungseffekt auf einen vermeintlich günstigen Surrogatmarker und der Behandlungseffekt auf den klinischen Zielendpunkt in entgegengesetzte Richtungen zeigen.
Das kann selbst dann vorkommen, wenn der Surrogatmarker stark mit dem Zielendpunkt assoziiert ist. Ursachen sind unter anderem:
- ein direkter schädlicher Behandlungspfad, der nicht über den Surrogatmarker läuft,
- Confounding zwischen Surrogat und Zielendpunkt,
- heterogene individuelle Behandlungseffekte,
- ein Marker, der nur einen Teil der relevanten Biologie abbildet,
- technische Assayeffekte.
Methodische Arbeiten zeigen, dass eine positive Surrogat-Endpunkt-Assoziation allein das Paradox nicht ausschließt.[6][7]
Kausales Schema
Angenommen:
beschreibt einen günstigen vermittelten Pfad. Gleichzeitig existiert:
,
wobei eine schädliche Nebenwirkung ist.
Dann kann gelten:
für eine „jüngere“ Uhr, während gleichzeitig:
für eine Funktion gilt, bei der höhere Werte besser wären.
Die Uhr verbessert sich, der Mensch aber nicht.
Szenario: Die Uhr verjüngt sich und die Funktion verschlechtert sich
Stelle Dir eine hypothetische Intervention PX-17 vor. Sie hemmt stark den hepatischen Akutphasen- und JAK/STAT-Signalweg. Dadurch sinken innerhalb von vier Wochen mehrere entzündungsassoziierte und leberbezogene Plasmaproteine, die in einer Proteomuhr hohe Gewichte besitzen.
Die eingefrorene Leber- und Immunuhr zeigt danach eine Verbesserung von −0,8 Standardabweichungen. Eine rein biomarkerzentrierte Interpretation würde von deutlicher „Verjüngung“ sprechen.
Gleichzeitig besitzt PX-17 eine mitochondriale Off-Target-Wirkung in Skelettmuskeln. Nach zwölf Wochen sinken VO2max, Handkraft und SPPB. Zusätzlich nimmt die Infektanfälligkeit zu.
Das Szenario kann durch drei Mechanismen erzeugt werden:
- Markerpfad: PX-17 senkt Proteine, die die Uhr als „alt“ interpretiert.
- Direkter Schadenspfad: PX-17 verschlechtert Muskelenergie und Immunabwehr unabhängig von der Uhr.
- Messpfad: Falls das Medikament zusätzlich Bindung oder Clearance einzelner Proteine verändert, kann der Plasmawert sinken, ohne dass das Ursprungsorgan biologisch jünger geworden ist.
Die Beobachtung
Uhr jünger → Funktion schlechter
ist kein Widerspruch. Sie zeigt vielmehr, warum ein prognostischer Biomarker nicht automatisch ein Interventionssurrogat ist.
Externe Validierungsstrategie
Die externe Validierung muss bereits vor Dateneinsicht als Protokoll oder Registered Report festgeschrieben werden.
Stufe 1: Modell einfrieren
Vor Beginn der externen Validierung werden archiviert:
- exakte Protein-IDs und Assayversion,
- Modellkoeffizienten beziehungsweise Baumstruktur,
- Normalisierungskonstanten,
- Regeln für Werte unter Nachweisgrenze,
- Missing-Data-Regeln,
- Age-Gap-Transformation,
- Definition aller Endpunkte,
- statistischer Analyseplan,
- Ablehnungskriterien.
Es darf keine nachträgliche Merkmalsauswahl im Validierungsdatensatz erfolgen.
Stufe 2: Validierungskohorten
Mindestens vier voneinander verschiedene Domänen sollten einbezogen werden:
- Populationskohorte: breite Altersverteilung und mehrere sozioökonomische Gruppen.
- Hochaltrigenkohorte: gezielt Personen über 80 Jahre.
- Klinische Kohorte: relevante Organerkrankungen und Multimorbidität.
- Interventionskohorte: randomisierte Studien mit wiederholten Proteommessungen und funktionellen Endpunkten.
Für echten Assay-Transport sollte mindestens eine Kohorte mit einer orthogonalen Technologie untersucht werden, zum Beispiel targeted Massenspektrometrie oder ein anderes bindungsbasiertes Assay.

Stufe 3: Präanalytische Kontrolle
Alter, Geschlecht, Zentrum und spätere Endpunkte werden über Messplatten randomisiert. Mindestens fünf Prozent der Proben werden als technische Replikate eingeplant. Erfasst werden:
- Nüchternstatus,
- Uhrzeit der Blutentnahme,
- Röhrchentyp,
- Zeit bis Zentrifugation,
- Lagerungsdauer,
- Zahl der Freeze-thaw-Zyklen,
- Messplatte und Charge.
Vor Freigabe des biologischen Audits wird geprüft, ob technische Variablen das chronologische Alter oder den Score vorhersagen.
Stufe 4: Kalibration der Altersvorhersage
Für jede Uhr werden berichtet:
- MAE,
- RMSE,
- ,
- Kalibrationsinterzept,
- Kalibrationssteigung,
- Residuen nach Alter,
- Fehler nach Geschlecht, Herkunft, Zentrum, Krankheit und Altersgruppe.
Ein gutes Modell benötigt nicht nur hohe Korrelation, sondern ungefähr:
.
Eine Bland-Altman-Darstellung zeigt zusätzlich, ob die Fehler an den Rändern des Altersspektrums systematisch zunehmen.
Stufe 5: Funktionelle Endpunkte
Die entscheidende externe Prüfung soll das Organ nicht mit derselben Proteomplattform „validieren“, sondern mit unabhängigen Funktionen.
| Uhr | Funktionelle oder klinische Validierungsendpunkte | Zu vermeidende Zirkularität |
|---|---|---|
| Gehirn | standardisierte Kognition, Alltagsfunktion, MRT-Volumina, Gang-Kognition-Dual-Task | keine reine Validierung durch weitere Plasmaproteine |
| Herz | Echokardiographie, Belastungskapazität, Peak-VO2, Herzinsuffizienzereignisse | nicht nur natriuretische Peptide |
| Lunge | FEV1, DLCO, Sechs-Minuten-Gehtest, respiratorische Hospitalisierung | nicht nur inflammatorische Plasmaproteine |
| Niere | gemessene oder valide geschätzte GFR-Verläufe, Albuminurie, Nierenersatztherapie | Clearanceeffekte der Proteine ausdrücklich modellieren |
| Muskel | Handkraft, Chair-Rise, SPPB, Peak-VO2, Muskelmasse | nicht nur muskelassoziierte Plasmaproteine |
| Leber | Elastographie, Synthesefunktion, Dekompensationsereignisse | Proteinkonzentration nicht mit Organfunktion gleichsetzen |
| Gefäße | Pulswellengeschwindigkeit, ABI, vaskuläre Ereignisse | systemische Entzündung als Confounder prüfen |
Stufe 6: Risiko-Kalibration unter konkurrierenden Ereignissen
Für 5- und 10-Jahres-Risiken werden verwendet:
- cause-specific Cox für ätiologische Hazard-Fragen,
- Aalen-Johansen-Kurven für kumulative Inzidenzen,
- competing-risk-gerechte absolute Risiko-Prognosen,
- zeitabhängiger Brier-Score,
- Kalibrationsplots,
- Kalibrationsinterzept und -steigung,
- C-Index oder zeitabhängige AUC,
- Decision-Curve-Analyse gegenüber einem klinischen Basismodell.
Die Uhr wird nicht akzeptiert, nur weil die Hazard Ratio statistisch signifikant ist.
Stufe 7: Zell- und Quellen-Audit
Jeder organspezifische Score wird erneut analysiert unter Adjustierung für:
- vollständiges Blutbild,
- verfügbare Immunzellanteile,
- eGFR,
- Leberfunktion,
- Entzündungsmarker,
- BMI,
- Medikamente,
- Rauchstatus,
- relevante Organerkrankungen.
Zusätzlich wird für jedes Scoreprotein dokumentiert:
Zelltypquelle – Sekretionsstatus – Membran/Shedding – Clearanceweg – mögliche Assayinterferenz.
Eine Organuhr sollte ihren Zusammenhang mit organunabhängig gemessener Funktion wenigstens teilweise behalten, wenn Zellmischung und Clearance berücksichtigt werden.
Stufe 8: Interventionsvalidierung
Für eine echte Surrogatprüfung werden mehrere randomisierte Studien mit mechanistisch verschiedenen Interventionen benötigt, zum Beispiel Training, Ernährungsintervention, metabolische Therapie und pharmakologische Geroprotektion.
Pro Studie werden erhoben:
- Änderung der Uhr nach 3, 6 und 12 Monaten,
- organbezogene Funktion,
- patientenrelevante Ereignisse,
- unerwünschte Ereignisse,
- Langzeit-Follow-up.
Auf Studienebene wird geprüft, ob die Behandlungseffekte auf die Uhr die Behandlungseffekte auf Funktion oder klinische Endpunkte vorhersagen:
.
Relevant sind , das studienbezogene , Unsicherheit und ein Surrogate Threshold Effect. Ein einzelner erfolgreicher Versuch genügt nicht.
Vorab definierte Ablehnungskriterien
Die folgenden Schwellen sind ein Beispiel für ein prospektives Protokoll. Sie sind keine universellen Naturkonstanten und müssen vor Datenzugriff begründet werden.
| Behauptung | Vorab definiertes Kriterium | Entscheidung |
|---|---|---|
| Transportierbare Altersuhr | Kalibrationssteigung außerhalb 0,80–1,20 oder absoluter Kalibrationsfehler über 3 Jahre in einer primären externen Kohorte | Behauptung der direkten Transportierbarkeit ablehnen |
| Robuste Altersuhr | MAE in mindestens einer vorab definierten Hauptgruppe mehr als 50 Prozent höher als im Gesamtdatensatz | Subgruppenrobustheit ablehnen |
| Assay-unabhängige Uhr | ICC zwischen primärer Plattform und orthogonalem Assay unter 0,75 | Plattformunabhängigkeit ablehnen |
| Organspezifität | Assoziation mit unabhängiger Organfunktion verschwindet nach Zellmischungs- und Clearanceadjustierung und 95-Prozent-Konfidenzintervall umfasst den Nullwert | starke organspezifische Interpretation ablehnen |
| Klinische Risikoprognose | 5- oder 10-Jahres-Kalibrationssteigung außerhalb 0,80–1,20 oder Brier-Score schlechter als das vorab definierte klinische Basismodell | klinische Prognosebehauptung ablehnen |
| Zusatznutzen | kein vorab definierter Nettonutzen gegenüber dem klinischen Basismodell | klinischen Zusatznutzen nicht beanspruchen |
| Interventionssurrogat | in einer ausreichend gepowerten RCT verbessert sich die Uhr um mindestens 0,5 SD, während sich der primäre funktionelle Endpunkt um mindestens seine vorab definierte klinisch relevante Differenz verschlechtert | Surrogatanspruch im betreffenden Context of Use ablehnen |
| Studienübergreifende Surrogatvalidität | untere Grenze des 95-Prozent-Konfidenzintervalls des vorab definierten trial-level R² liegt unter 0,50 oder das Vorhersageintervall erlaubt klinisch relevanten Schaden trotz günstiger Uhrenänderung | validiertes Surrogat nicht beanspruchen |
Ein besonders wichtiges Kriterium ist die Richtungsstabilität: Wenn die Uhr in mehreren mechanistisch verschiedenen Studien „jünger“ wird, der funktionelle Effekt aber zwischen Nutzen, Nullwirkung und Schaden wechselt, ist die Uhr möglicherweise ein Response-Biomarker, aber kein zuverlässiges Surrogat.
Was ein positives Ergebnis bedeuten darf
Nach einem sauberen Audit sollten Aussagen hierarchisch formuliert werden:
Ebene 1: Altersmarker
„Der Score sagt chronologisches Alter extern kalibriert voraus.“
Ebene 2: Prognostischer Marker
„Der Score liefert zusätzlich zu klinischen Variablen kalibrierte Information über zukünftige Ereignisse.“
Ebene 3: Organbezogener Marker
„Der Score bleibt mit unabhängiger Organfunktion assoziiert, nachdem Zellmischung, Clearance und systemische Alterung berücksichtigt wurden.“
Ebene 4: Interventionssurrogat
„Behandlungseffekte auf den Score sagen in mehreren randomisierten Studien Behandlungseffekte auf patientenrelevante Zielendpunkte ausreichend zuverlässig voraus.“
Zwischen diesen Ebenen gibt es keine automatische Aufstufung.
Methodische Fallstricke im Professorenkolleg
Regression zur Mitte
Personen mit extrem alten Uhrenwerten werden bei Wiederholungsmessung allein durch Messfehler häufig näher am Mittelwert liegen. Eine scheinbare „Verjüngung“ nach Intervention kann daher teilweise Regression zur Mitte sein.
Lösung: Randomisierung, Kontrollgruppe, wiederholte Baseline-Messungen und Analyse der Treatment-by-Time-Differenz.
Lord's Paradox und Baselineadjustierung
Änderungsscores und ANCOVA können bei Baselineunterschieden unterschiedliche Schätzer liefern. Für randomisierte Studien sollte die primäre Analysemethode vorab spezifiziert werden.
Regression Dilution
Technischer Messfehler schwächt Zusammenhänge und kann Interventionsänderungen instabil machen. Intraklassenkorrelation und technische Replikate sind daher Teil der biologischen Validierung.
Collider Bias
Wenn die Aufnahme in eine Biobank sowohl von Gesundheit als auch von sozialen Faktoren beeinflusst wird, kann Konditionierung auf Studienteilnahme künstliche Zusammenhänge erzeugen. UK Biobank ist eine wertvolle Ressource, aber keine zufällige Stichprobe der Gesamtbevölkerung.
Informative Zensierung
Verlust zum Follow-up, klinische Untersuchungshäufigkeit oder Tod können mit dem Score zusammenhängen. Reine Standardzensierung kann dann absolute Risiken verzerren.
Professoren-Audit: Minimaler Prüfbericht
Ein belastbarer Auditbericht sollte für jede Uhr folgende Fragen explizit beantworten:
- Target: Wurde Alter, Krankheit, Mortalität oder Interventionseffekt trainiert?
- Locking: Welche Teile der Pipeline sind tatsächlich eingefroren?
- Leakage: Können Alter, Outcome oder Batch indirekt in den Score gelangen?
- Source validity: Wie sicher ist die organspezifische Herkunft der Proteine?
- Cell mixture: Welche Zelltypverschiebungen könnten den Score treiben?
- Transport: Welche Populationen und Plattformen wurden wirklich extern getestet?
- Calibration: Wurde nicht nur Korrelation, sondern Kalibration gezeigt?
- Competing risk: Wie wurde Tod bei Erkrankungsrisiken behandelt?
- Function: Welche unabhängigen funktionellen Endpunkte wurden verwendet?
- Intervention: Existieren randomisierte Daten?
- Surrogacy: Wurden Behandlungseffekte auf Marker und klinischen Endpunkt studienübergreifend gekoppelt?
- Rejection: Welche vorab festgelegten Kriterien würden die Hypothese widerlegen?
Medien zur methodischen Einordnung

Die Abbildung zeigt den schematischen Aufbau eines Massenspektrometers. Proteomische Uhren können je nach Plattform auf Massenspektrometrie, Aptameren oder Antikörper-basierten Verfahren beruhen. Plattformwechsel ist deshalb selbst eine externe Validierungsfrage.

Ein Massenspektrum ist ein Messsignal, kein biologischer Endpunkt. Dieselbe methodische Vorsicht gilt für einen zusammengesetzten Uhrenwert: Erst Validierung bestimmt, welche Interpretation zulässig ist.
Quellen und Vertiefung
- Oh et al. 2023: Organ aging signatures in the plasma proteome track health and disease
- Wang et al. 2025: Organ-specific proteomic aging clocks predict disease and longevity across diverse populations
- Argentieri et al. 2024: Proteomic aging clock predicts mortality and risk of common age-related diseases in diverse populations
- Surrogate endpoints: a key concept in clinical epidemiology
- Surrogacy marker paradox measures in meta-analytic settings
- ISPOR 2026: Methods for Evaluation of Surrogate Endpoints
- FDA Biomarker Qualification
- ↑ 1,0 1,1 1,2 1,3 Oh H.S.-H. et al. Organ aging signatures in the plasma proteome track health and disease. Nature 624, 164–172, 2023.
- ↑ 2,0 2,1 2,2 2,3 2,4 2,5 2,6 2,7 2,8 Wang Y. et al. Organ-specific proteomic aging clocks predict disease and longevity across diverse populations. Nature Aging, veröffentlicht 2025.
- ↑ 3,0 3,1 Argentieri M.A. et al. Proteomic aging clock predicts mortality and risk of common age-related diseases in diverse populations. Nature Medicine 30, 2450–2460, 2024.
- ↑ 4,0 4,1 FDA: About Biomarkers and Qualification.
- ↑ 5,0 5,1 ISPOR Task Force: Methods for Evaluation of Surrogate Endpoints for Health Technology Assessment Decision Making, 2026.
- ↑ VanderWeele T.J. Surrogate measures and consistent surrogates.
- ↑ Elliott M.R. et al. Surrogacy marker paradox measures in meta-analytic settings.
Interaktive Aufgaben
Quiz: Teste Dein Wissen
Welche Aussage beschreibt eine Altersvorhersage am treffendsten? (Sie schätzt chronologisches Alter aus Biomarkern) (!Sie beweist die Wirksamkeit einer Intervention) (!Sie ersetzt jeden klinischen Endpunkt) (!Sie garantiert organspezifische Kausalität)
Welche Eigenschaft ist für klinische Risikoprognose zusätzlich zur Diskrimination zentral? (Kalibration) (!Publikationsjahr) (!Anzahl der Autoren) (!Farbe der Messplatte)
Was kennzeichnet ein validiertes Interventionssurrogat? (Behandlungseffekte auf den Marker sagen Behandlungseffekte auf den klinischen Endpunkt zuverlässig voraus) (!Der Marker korreliert einmalig mit dem Alter) (!Der Marker stammt aus Blut) (!Der Marker besitzt viele Proteine)
Welches Problem entsteht, wenn Age Gaps in jeder Testkohorte neu standardisiert werden? (Die Individualbewertung hängt teilweise von der Testkohorte ab) (!Es gibt keine Proteine mehr) (!Das chronologische Alter wird unbekannt) (!Jede Hazard Ratio wird automatisch eins)
Warum kann Bulk-Gewebeexpression die Organspezifität überschätzen? (Sie vermischt Genregulation mit Zelltypzusammensetzung) (!Sie misst ausschließlich DNA) (!Sie enthält keine Gene) (!Sie verhindert jede Proteinanalyse)
Was ist bei Demenzrisiko im hohen Alter ein typisches konkurrierendes Ereignis? (Tod) (!Korrelation) (!Standardisierung) (!Proteinannotation)
Welche Methode beschreibt kumulative Erkrankungsinzidenz bei konkurrierendem Tod? (Aalen-Johansen-Schätzung) (!Einfache lineare Regression) (!Ungeprüfte Kaplan-Meier-Interpretation) (!Pearson-Korrelation allein)
Welches Ergebnis wäre ein Surrogatparadox? (Die Uhr wird jünger während sich die Funktion verschlechtert) (!Die Uhr bleibt stabil und die Funktion bleibt stabil) (!Alter und Geburtsjahr stimmen überein) (!Ein Assay wird technisch repliziert)
Welche Validierung ist für eine Gehirnuhr besonders unabhängig? (Kognition und Bildgebung zusätzlich zum Plasmaproteom) (!Noch einmal dieselben Plasmaproteine) (!Nur die Trainingskorrelation) (!Nur eine neue Farbcodierung)
Wann sollte der Surrogatanspruch verworfen werden? (Wenn eine relevante Uhrenverbesserung mit klinisch relevantem Funktionsschaden einhergeht) (!Wenn das Modell reproduzierbar ist) (!Wenn technische Replikate vorhanden sind) (!Wenn das Alter korrekt gemessen wurde)
Memory
| Altersvorhersage | Chronologisches Alter als Ziel |
| Risikoprognose | Zukünftige Ereignisse mit Kalibration |
| Surrogatvalidierung | Behandlungseffekte auf Marker und Zielendpunkt |
| Zellmischung | Veränderliche Anteile verschiedener Zelltypen |
| Kohortentransport | Gültigkeit in einer neuen Population |
| Competing Risk | Ereignis verhindert das Auftreten des Zielereignisses |
| Leakage | Information aus Test oder Ziel gelangt in die Modellierung |
Drag and Drop
| Ordne die richtigen Begriffe zu. | Thema |
|---|---|
| Kalibration | Übereinstimmung vorhergesagter und beobachteter Werte |
| Diskrimination | Trennung von Personen mit und ohne späteres Ereignis |
| Deconvolution | Abschätzung von Zelltypbeiträgen |
| Aalen-Johansen | Kumulative Inzidenz unter konkurrierenden Ereignissen |
| Locked Model | Eingefrorene Pipeline vor externer Prüfung |
| Surrogatparadox | Günstiger Markereffekt bei ungünstigem klinischem Effekt |
Kreuzworträtsel
| Proteomik | Wie heißt die systematische Untersuchung vieler Proteine? |
| Leakage | Wie heißt das unzulässige Eindringen von Testinformation in die Modellierung? |
| Kalibration | Wie heißt die Übereinstimmung von Vorhersage und Beobachtung? |
| Surrogat | Wie heißt ein Ersatzendpunkt für einen klinischen Zielendpunkt? |
| Mortalität | Welcher Endpunkt konkurriert häufig mit späteren Alterserkrankungen? |
| Deconvolution | Wie heißt die rechnerische Trennung gemischter Zellanteile? |
LearningApps
Lückentext
Offene Aufgaben
Leicht
- Begriffslandkarte Proteomische Uhr: Erstelle eine Grafik, die Altersvorhersage, Risikoprognose und Interventionssurrogat klar voneinander trennt.
- Leakage-Beispiele: Formuliere fünf mögliche Leakage-Pfade in einer Proteomstudie und markiere, an welcher Stelle der Pipeline sie entstehen.
- Organquelle: Wähle drei Proteine einer hypothetischen Organuhr und beschreibe, welche zusätzlichen Daten nötig wären, um ihre Organherkunft zu belegen.
- Competing Risk: Zeichne ein Ereignisdiagramm für Demenz, Tod und Ende der Nachbeobachtung.
Standard
- Replikationsplan: Entwirf ein externes Validierungsprotokoll für eine Muskel-Proteomuhr mit mindestens drei funktionellen Endpunkten.
- Kalibrationsaudit: Simuliere zwei Uhren mit gleicher Korrelation, aber unterschiedlicher Kalibrationssteigung, und erkläre die Konsequenzen.
- Zellmischungsprojekt: Entwickle ein Analysekonzept, mit dem Blutbild und Single-Cell-Referenzen in einen Zellmischungs-Audit einbezogen werden.
- Surrogatparadox-Fallstudie: Gestalte eine einseitige Fallvignette, in der sich ein Proteomuhrwert verbessert und ein klinischer Endpunkt verschlechtert.
Schwer
- Trial-Level-Surrogacy: Entwirf eine Meta-Analyse über mindestens fünf hypothetische RCTs und definiere, wie Behandlungseffekte auf Uhr und Funktion gekoppelt werden.
- Transportanalyse: Entwickle einen Plan für Olink-zu-Massenspektrometrie-Transport einschließlich Bridge-Samples, ICC und Kalibrationsprüfung.
- Kausales Diagramm: Zeichne ein DAG mit Intervention, Proteomuhr, Zellmischung, Organfunktion, Nebenwirkung und Mortalität und identifiziere unzulässige Adjustierungen.
- Reject-Kriterien: Schreibe ein präregistrierbares Set von Kriterien, bei deren Verletzung Du die Behauptungen Altersuhr, Organspezifität, Risikomarker und Surrogat jeweils getrennt zurückweist.


Lernkontrolle
- Audit einer publizierten Uhr: Wähle eine organspezifische Proteomuhr und begründe anhand von Design, Preprocessing und Validierung, welche Behauptungen die Studie trägt und welche nicht.
- Kausalität und Surrogat: Erkläre mit einem DAG, wie eine Intervention gleichzeitig einen Uhrenwert verbessern und die Organfunktion verschlechtern kann.
- Kohortentransport: Übertrage ein in der UK Biobank trainiertes Modell gedanklich auf eine geriatrische Krankenhauskohorte und benenne mindestens fünf erwartbare Verschiebungen.
- Competing-Risk-Transfer: Vergleiche die Interpretation eines cause-specific Cox-Modells mit einer kumulativen Inzidenzfunktion für einen Endpunkt Deiner Wahl.
- Funktionsvalidierung: Entwickle für Gehirn, Herz und Muskel jeweils einen Proteom-unabhängigen funktionellen Validierungsendpunkt und begründe die Auswahl.
- Ablehnungsentscheidung: Beurteile ein hypothetisches Ergebnis, in dem die Alterskalibration gut, die Risikokalibration schlecht und die Interventionswirkung paradox ist. Formuliere getrennte Schlussfolgerungen für die drei Evidenzebenen.
Lernnachweis
Für einen Lernnachweis zu diesem Thema ist wichtig, dass Du:
- Altersvorhersage, Risikoprognose und Interventionssurrogat methodisch sauber trennst.
- Leakage in Preprocessing, Merkmalsauswahl, Age-Gap-Bildung und externer Validierung erkennen kannst.
- erklären kannst, warum Bulk-Organexpression und Plasmaquelle nicht identisch sind.
- Zellmischung, Sekretion, Shedding und Clearance als alternative Erklärungen proteomischer Signale einordnest.
- externe Validierung nicht mit interner Testteilung verwechselst.
- Alters- und Risikokalibration interpretieren kannst.
- competing-risk-gerechte Analysen für Alterserkrankungen begründen kannst.
- funktionelle, vom Proteom unabhängige Endpunkte auswählst.
- das Surrogatparadox kausal erklären kannst.
- vorab definierte Reject-Kriterien formulierst und konsequent anwendest.
OERs zum Thema
Verknüpfte Lernbereiche
aiMOOC-Projekte
MOOCwiki · Deutsch
Nach dem Lernen ist vor dem Lernen
Entdecke direkt den nächsten Lernkurs. Weitere Inhalte erscheinen, wenn Du weiter nach unten scrollst.
Zur MOOCwiki-HauptseiteMediathek
Mediathek wird aus dem Wiki geladen ...
Keine passenden Inhalte gefunden. Bitte ändere Suche oder Filter.
NEWSLernweltNOAH fragen