KI vs. Ärzte: Was die Studien wirklich zeigen
Die meisten Studien, in denen eine KI angeblich Ärzte schlägt, vergleichen einen Algorithmus bei genau einer eng umrissenen Aufgabe mit Ärztinnen und Ärzten, die dieselbe begrenzte Eingabe bekommen: meistens ein kuratiertes Bildset oder einen Textblock. Unter diesen Bedingungen liegt die KI oft gleichauf mit Fachärzten oder darüber, und das seit 2016 immer wieder. Unter den Bedingungen, unter denen ein Arzt tatsächlich arbeitet, also Anamnese erheben, untersuchen, bei lückenhaften Daten entscheiden und die Folgen eines Irrtums tragen, ist der Vergleich praktisch nie gelaufen.
Was eine Studie „KI gegen Ärzte" tatsächlich vergleicht
Fast jede Schlagzeile, die du gesehen hast, stammt aus einem von drei Designs. Eine retrospektive Datensatzstudie lässt das Modell über gespeicherte Bilder oder Akten laufen, bei denen die richtige Antwort schon feststeht. Eine Reader-Studie legt einem kleinen Panel von Ärzten dieselben gespeicherten Fälle vor und vergleicht die Ergebnisse. Eine prospektive Studie setzt das System in einen laufenden klinischen Ablauf und misst, was mit den Patienten passiert. Die ersten beiden sind häufig und billig. Die dritte ist selten und teuer, und sie ist die einzige, die überhaupt etwas über die Praxis aussagt.
Der Abstand zwischen diesen Designs ist gut dokumentiert. In einem systematischen Review in The Lancet Digital Health sichteten Liu und Kollegen 2019 über zwanzigtausend Arbeiten zu Deep Learning in der medizinischen Bildgebung und fanden nur eine Handvoll, weniger als zwanzig, die Algorithmus und Fachpersonal an derselben Stichprobe testeten. Wo das geschah, lagen die Leistungen grob im gleichen Bereich. Nagendran und Kollegen kamen 2020 im BMJ über dieselbe Literatur zu dem Schluss, dass randomisierte Studien fast völlig fehlen, die meisten Arbeiten ein hohes Verzerrungsrisiko tragen und die Formulierungen in den Abstracts der Evidenz in den Tabellen vorauseilen.
Wenn du also liest „KI übertrifft Ärzte", lautet die ehrliche Übersetzung meistens: auf diesem Datensatz, gegen diese Anzahl Befunder, bei dieser einen Aufgabe.
Nebeneinander, Aufgabe für Aufgabe
| Aufgabe | Beste Evidenz für die KI | Wo Ärztinnen und Ärzte vorn liegen |
|---|---|---|
| Diabetische Retinopathie auf Netzhautfotos | Gulshan et al., JAMA 2016: Sensitivität und Spezifität auf dem Niveau eines Augenarzt-Panels oder darüber, auf den Validierungsdatensätzen | Die Entscheidung, wie es mit jemandem weitergeht, dessen Aufnahme nicht beurteilbar ist oder der keine Praxis erreicht |
| Klassifikation von Hautveränderungen | Esteva et al., Nature 2017: ein neuronales Netz lag auf kuratierten Bildsets gleichauf mit Fachärzten für Dermatologie | Läsionen auf Hauttypen, Körperstellen und mit Kameras, die in den Trainingsdaten kaum vorkamen |
| Mammografie-Screening | McKinney et al., Nature 2020: weniger falsch positive und falsch negative Befunde als die Befunder, auf retrospektiven Daten aus Großbritannien und den USA | Laufende Screening-Programme, in denen das Modell auf eine Bevölkerung trifft, für die es nie validiert wurde |
| Diagnostisches Gespräch per Text | Die AMIE-Studie von Google in Nature: höhere diagnostische Treffsicherheit als Hausärzte, randomisiert, im Chat mit simulierten Patienten | Jede Begegnung, die eine körperliche Untersuchung braucht, oder ein echter Patient, der ausgerechnet das entscheidende Detail weglässt |
| Diagnostisches Denken mit LLM-Unterstützung | Goh et al., JAMA Network Open 2024: das Modell allein schnitt besser ab als die Ärzte | Ärzte mit Modell schlugen Ärzte mit den üblichen Hilfsmitteln nicht deutlich |
Die letzte Zeile ist das interessanteste Ergebnis der Tabelle und wird am seltensten zitiert. Wenn das Modell allein die Ärzte schlägt, Ärzte plus Modell aber nicht besser sind als Ärzte allein, dann liegt der Engpass nicht in der reinen Treffsicherheit. Er liegt darin, wie jemand entscheidet, wann er eine Antwort übernimmt, die er nicht selbst hergeleitet hat.
Wo Ärztinnen und Ärzte klar vorn sind
Fälle, die in den Daten nie vorkamen. Die Leistung eines Modells ist eine Eigenschaft seiner Trainingsverteilung. Setz es auf einen anderen Scanner, eine andere Bevölkerung oder eine Krankheitshäufigkeit, die es nie gesehen hat, und die Treffsicherheit fällt, ohne dass irgendein Warnsignal aufleuchtet. Menschen bauen langsamer ab, weil sie merken, dass ihnen etwas fremd vorkommt, und dann jemanden dazuholen.
Alles, was passiert, bevor das Bild überhaupt existiert. Irgendwer hat entschieden, dass diese Patientin ein CT braucht und dass dieser Brustschmerz heute Nacht abgeklärt gehört. Diese Triage ist der größere Teil der Medizin, und genau den lassen die Benchmarks weg.
Das Modell lernt nichts aus deinem Fall. Ein ausgeliefertes Diagnosesystem rechnet gegen eingefrorene Gewichte. Es erinnert sich nicht an den Patienten von heute Morgen, und es korrigiert sich nicht, wenn es falsch lag. Das ist das genaue Gegenteil davon, wie eine Ärztin über Jahre klinisches Urteil aufbaut. Wenn dir dieser Unterschied nicht ganz klar ist, lohnt es sich zu verstehen, was sich zwischen Training und Inferenz ändert, bevor du die nächste Leistungsaussage liest.
Reproduzierbarkeit. Die Mammografie-Arbeit von 2020 zog eine formale Erwiderung in Nature nach sich: Haibe-Kains und Kollegen argumentierten, dass sich das Ergebnis ohne veröffentlichten Code und Modelldetails nicht unabhängig überprüfen lässt. Dieser Einwand trifft einen großen Teil der Literatur.
Verantwortung. Bisher hat keine Studie ein System hervorgebracht, das für ein Behandlungsergebnis geradestehen kann.
Wem du wobei vertrauen kannst
Beim Massen-Screening eines einzelnen, klar definierten Signals, auf Daten, die den Validierungsdaten ähneln, ist die Evidenz für KI wirklich stark. Ein zweiter automatischer Blick fängt auf, was ein müdes Auge um 16 Uhr beim vierzigsten Bild des Tages übersieht.
Bei einem unspezifischen Problem, also der Sorte, die als „mir geht es seit drei Wochen komisch" in die Sprechstunde kommt, spricht die Evidenz für den Menschen, und zwar deutlich. Nichts in der aktuellen Literatur testet ein Modell an der vollständigen Aufgabe.
Für deine eigene Gesundheit ist die Ärztin diejenige, die dich untersuchen, die Untersuchung veranlassen und den Befund weiterverfolgen kann. Ein Chatbot hilft dir, vor dem Termin deine Fragen zu sortieren. Er ersetzt den Termin nicht, und ein Studien-Abstract als Erlaubnis zu lesen, ihn ausfallen zu lassen, ist der teuerste Fehler, der hier zur Auswahl steht.
So liest du die nächste Schlagzeile
- Finde die Aufgabe. Eine Krankheit, eine Modalität, eine Ja-Nein-Entscheidung? Dann gilt die Aussage dafür, nicht für die Medizin.
- Finde die Vergleichsgruppe. Sechs Befunder in einer Reader-Studie sind nicht „die Ärzte".
- Frag, ob die Menschen dieselben Informationen hatten. Radiologen, die Bilder ohne klinische Vorgeschichte befunden, arbeiten mit einer Hand auf dem Rücken.
- Such nach externer Validierung. Wurde das Modell nie an Daten einer Einrichtung außerhalb des Trainingssets geprüft, ist die Zahl eine Obergrenze und keine Prognose.
Wenn du diese Paper fürs Studium liest
Einen Methodenteil gelesen zu haben ist nicht dasselbe, wie das Argument drei Wochen später in der Klausur rekonstruieren zu können. Ob Physikum, Staatsexamen oder eine Uni-Klausur im Nebenfach: In den Experimenten von Roediger und Karpicke aus dem Jahr 2006 behielten Studierende, die sich selbst abfragten, deutlich mehr als Studierende, die den Stoff noch einmal lasen, obwohl sich das erneute Lesen im Moment produktiver anfühlte.
Die praktische Fassung: Paper zuschlagen und aus dem Kopf aufschreiben, was verglichen wurde und wo die Einschränkung lag. Deine eigenen Mitschriften und Paper in Fragen zu verwandeln, die du beantworten musst, ist derselbe Mechanismus im großen Maßstab, egal ob du dir die Übungsklausur von Hand baust oder ein Werkzeug wie Qora nutzt, das Fragen aus dem Material erzeugt, das du wirklich gelernt hast, statt aus einer allgemeinen Fragendatenbank.
Häufige Fragen
Hat eine KI in einer Studie wirklich Ärzte geschlagen?
Ja, in mehreren, bei eng umrissenen Aufgaben. Für die Erkennung diabetischer Retinopathie, die Klassifikation von Hautveränderungen und das Mammografie-Screening gibt es publizierte Ergebnisse, in denen das Modell die ärztliche Vergleichsgruppe erreichte oder übertraf. Alle liefen auf ausgewählten Datensätzen, die meisten retrospektiv.
Halten diese Ergebnisse im Klinikalltag stand?
Oft nicht auf demselben Niveau. Reviews in The Lancet Digital Health und im BMJ fanden übereinstimmend, dass prospektive Studien selten sind und die meisten publizierten Vergleiche ein hohes Verzerrungsrisiko tragen. Was an einem kuratierten Testset gemessen wird, ist der beste Fall, nicht der zu erwartende.
Kann KI Ärzte ersetzen?
Nach aktueller Evidenz nicht, und das aufschlussreichste Ergebnis ist die randomisierte Studie von 2024: Ärzte mit LLM schnitten nicht klar besser ab als Ärzte mit den üblichen Hilfsmitteln, obwohl das Modell allein höher punktete. Die Integration in die klinische Arbeit ist ein ungelöstes Problem, unabhängig von der Treffsicherheit.
Sollte ich bei Symptomen einen KI-Chatbot fragen?
Für Fachbegriffe, zur Vorbereitung von Fragen oder um einen Befund einzuordnen, den du schon hast, ist das sinnvoll. Eine Diagnose ist es nicht, untersuchen kann dich der Chatbot nicht, und er hat keine Möglichkeit zu wissen, was er über deinen Fall nicht weiß.
Kurz gesagt: KI hat bei klar abgegrenzten diagnostischen Aufgaben tatsächlich gewonnen, und diese Erfolge sind echt und nützlich. Nicht gezeigt wurde Überlegenheit bei der Tätigkeit selbst, weil zu dieser Tätigkeit genau die Teile gehören, die die Studien weglassen. Wenn dir das nächste Ergebnis über den Weg läuft, klär drei Dinge, bevor du dir eine Meinung bildest: welche einzelne Aufgabe gemessen wurde, auf wessen Daten gemessen wurde und wie viele Ärztinnen und Ärzte auf der anderen Seite des Vergleichs standen.