IA vs médecins : ce que disent vraiment les études
La plupart des études qui annoncent que l'IA bat les médecins comparent un algorithme sur une tâche très étroite à des cliniciens qui reçoivent exactement la même entrée limitée, en général une série d'images triées ou un bloc de texte. Dans ces conditions, l'IA égale ou dépasse souvent les spécialistes, et elle le fait de façon répétée depuis 2016. Dans les conditions où un médecin travaille vraiment, interroger un patient, l'examiner, décider quoi faire quand les données sont incomplètes et assumer les conséquences d'une erreur, la comparaison n'a presque jamais été menée.
Ce que compare vraiment une étude « IA contre médecins »
Presque tous les titres que tu as vus passer viennent de l'un de ces trois protocoles. L'étude rétrospective sur base de données fait tourner le modèle sur des images ou des dossiers déjà archivés, dont la réponse est connue. L'étude de lecteurs donne les mêmes cas archivés à un petit panel de cliniciens et compare les scores. L'essai prospectif installe le système dans un vrai circuit de soins et mesure ce qui arrive aux patients. Les deux premiers protocoles sont fréquents et peu coûteux. Le troisième est rare et cher, et c'est le seul qui dit quelque chose sur la pratique réelle.
L'écart entre ces protocoles est documenté. Dans une revue systématique publiée en 2019 dans The Lancet Digital Health, Liu et ses collègues ont passé au crible plus de vingt mille articles sur l'apprentissage profond en imagerie médicale, et n'en ont trouvé qu'une poignée, moins de vingt, qui comparaient l'algorithme et des professionnels de santé sur le même échantillon de test. Dans ceux-là, les performances étaient globalement comparables. Une revue du BMJ publiée en 2020 par Nagendran et ses collègues a examiné la même littérature et conclu que les essais randomisés étaient quasi absents, que la plupart des études présentaient un risque de biais élevé, et que les affirmations des résumés allaient plus loin que les résultats des tableaux.
Donc quand tu lis « l'IA fait mieux que les médecins », la traduction honnête est en général : « sur ce jeu de données, face à ce nombre de lecteurs, sur cette tâche unique ».
Tâche par tâche, côte à côte
| Tâche | Meilleure preuve du côté de l'IA | Là où le clinicien garde l'avantage |
|---|---|---|
| Rétinopathie diabétique sur photos du fond d'œil | Gulshan et al., JAMA 2016 : sensibilité et spécificité au niveau d'un panel d'ophtalmologues ou au-dessus, sur les jeux de validation | Décider de la suite pour un patient dont l'image est ininterprétable, ou qui n'a pas accès à une consultation |
| Classification des lésions cutanées | Esteva et al., Nature 2017 : un réseau de neurones au niveau de dermatologues certifiés sur des séries d'images sélectionnées | Les lésions sur des carnations, des zones du corps et des appareils photo peu représentés dans les données d'entraînement |
| Dépistage du cancer du sein par mammographie | McKinney et al., Nature 2020 : moins de faux positifs et de faux négatifs que les lecteurs, sur des données rétrospectives britanniques et américaines | Un programme de dépistage en vrai, où le modèle rencontre une population sur laquelle il n'a jamais été validé |
| Consultation diagnostique par écrit | L'étude AMIE de Google, dans Nature : meilleure précision diagnostique que des médecins généralistes, dans une étude randomisée avec des patients simulés, par chat | Toute rencontre qui demande un examen clinique, ou un vrai patient qui oublie de mentionner le détail décisif |
| Raisonnement diagnostique assisté par un LLM | Goh et al., JAMA Network Open 2024 : le modèle seul obtient un meilleur score que les médecins | Les médecins équipés du modèle ne battent pas clairement les médecins avec leurs ressources habituelles |
Cette dernière ligne est le résultat le plus intéressant du tableau, et le moins repris. Si le modèle seul bat les médecins, et que les médecins plus le modèle ne battent pas le modèle seul, alors le goulot d'étranglement n'est pas la précision brute. C'est la façon dont un clinicien décide d'accepter ou non une réponse qu'il n'a pas produite lui-même.
Là où les médecins gardent nettement l'avantage
Les cas que les données ne contenaient pas. La performance d'un modèle est une propriété de sa distribution d'entraînement. Change de machine, de population, ou de prévalence de la maladie, et la précision peut chuter sans aucun signal d'alerte. Les cliniciens se dégradent plus doucement, parce qu'ils sont capables de remarquer qu'une situation ne leur est pas familière et de passer la main.
Tout ce qui se passe avant que l'image existe. Quelqu'un a décidé que ce patient avait besoin d'un examen, que cette douleur thoracique méritait d'être explorée ce soir. Cette étape de tri, c'est l'essentiel de la médecine, et c'est précisément ce que les benchmarks sautent.
Le modèle n'apprend pas de ton cas. Un système diagnostique déployé fait de l'inférence avec des poids figés. Il ne se souvient pas du patient vu ce matin et il ne se corrige pas quand il se trompe, exactement l'inverse de la façon dont un clinicien construit son jugement au fil d'une carrière. Si cette distinction reste floue pour toi, ça vaut le coup de comprendre ce qui change entre apprentissage et inférence avant de lire la prochaine annonce de performance.
La reproductibilité. L'article de 2020 sur le dépistage du cancer du sein a reçu une réponse formelle dans Nature, signée Haibe-Kains et ses collègues, qui soutenaient que sans publication du code et des détails du modèle, le résultat ne pouvait pas être vérifié de façon indépendante. L'objection vaut pour une grande partie de cette littérature.
La responsabilité. Aucune étude n'a produit à ce jour un système que l'on puisse tenir pour responsable d'un résultat.
À qui faire confiance, et pour quoi
Pour le dépistage à grand volume d'un signal unique et bien défini, sur des données qui ressemblent à celles sur lesquelles le modèle a été validé, les preuves en faveur de l'IA sont solides. Une seconde lecture automatisée peut rattraper ce qu'un œil fatigué a manqué à 17 h sur le quarantième examen de la journée.
Pour un problème indifférencié, le genre qui arrive sous la forme « je me sens bizarre depuis trois semaines », les preuves penchent du côté du clinicien, et pas de peu. Rien dans la littérature actuelle ne teste un modèle sur le métier entier.
Pour ta propre santé, le médecin est celui qui peut t'examiner, prescrire l'examen et assurer le suivi du résultat. Un chatbot peut t'aider à préparer tes questions avant un rendez-vous. Il ne remplace pas le rendez-vous, et lire le résumé d'une étude comme une autorisation de le sauter est l'erreur la plus coûteuse disponible ici.
Comment lire le prochain titre
- Cherche la tâche. Une maladie, une modalité d'imagerie, une décision binaire ? Alors l'affirmation porte là-dessus, pas sur la médecine.
- Cherche le groupe de comparaison. Six lecteurs dans une étude de lecteurs, ce n'est pas « les médecins ».
- Demande-toi si les humains avaient la même information. Des radiologues qui lisent des images privées de tout contexte clinique travaillent avec une main dans le dos.
- Vérifie la validation externe. Si le modèle n'a jamais été testé sur les données d'un établissement extérieur au jeu d'entraînement, le chiffre est un plafond, pas une prévision.
Si tu es l'étudiant qui lit ces articles
Lire une section « méthodes » n'est pas la même chose que savoir reconstruire l'argument à l'écrit trois semaines plus tard, en partiel ou au concours. Dans les expériences de Roediger et Karpicke en 2006, les étudiants qui se testaient sur un contenu en retenaient nettement plus que ceux qui le relisaient, alors même que la relecture donnait sur le moment l'impression d'être plus productive. La version pratique : ferme l'article et écris de mémoire ce qui a été comparé et quelle était la limite. Transformer tes propres cours et tes propres lectures en questions auxquelles tu dois répondre, c'est le même mécanisme appliqué à grande échelle, que tu le fasses en fabriquant un examen blanc à la main ou avec un outil comme Qora, qui génère les questions à partir du contenu que tu as réellement travaillé plutôt que d'une banque de questions générique.
Questions fréquentes
Est-ce que l'IA a vraiment battu des médecins dans une étude ?
Oui, dans plusieurs, sur des tâches étroites. Le dépistage de la rétinopathie diabétique, la classification des lésions cutanées et la mammographie ont tous donné lieu à des résultats publiés où le modèle égale ou dépasse le groupe de cliniciens. Tous portaient sur des jeux de données sélectionnés, et la plupart étaient rétrospectifs.
Ces résultats tiennent-ils dans un vrai hôpital ?
Souvent pas au même niveau. Les revues du Lancet Digital Health et du BMJ ont toutes deux constaté que les essais prospectifs sont rares et que la plupart des comparaisons publiées présentent un risque de biais élevé. Une performance mesurée sur un jeu de test trié est le meilleur des cas, pas le cas attendu.
L'IA peut-elle remplacer les médecins ?
Pas au vu des preuves actuelles. Le résultat le plus parlant reste l'essai randomisé de 2024, où les médecins équipés d'un LLM n'ont pas clairement fait mieux que les médecins avec leurs ressources habituelles, alors même que le modèle seul obtenait un meilleur score. L'intégration dans le travail clinique est un problème non résolu, distinct de celui de la précision.
Faut-il utiliser un chatbot pour ses symptômes ?
C'est raisonnable pour comprendre un terme, préparer tes questions ou décrypter un compte rendu que tu as déjà. Ce n'est pas un diagnostic, il ne peut pas t'examiner, et il n'a aucun moyen de savoir ce qu'il ignore de ton cas.
En résumé : l'IA a réellement gagné sur des tâches diagnostiques précises et bien délimitées, et ces victoires sont vraies et utiles. Ce qui n'a pas été démontré, c'est une supériorité sur le métier, parce que le métier inclut justement les parties que les études laissent de côté. La prochaine fois qu'un résultat passe dans ton fil, cherche trois choses avant de te faire un avis : quelle tâche unique a été mesurée, sur les données de qui, et combien de cliniciens se tenaient de l'autre côté de la comparaison.