Vous avez probablement croisé le titre : ChatGPT diagnostique mieux que les médecins. Il a fait le tour de la presse française fin 2024, et il est exact.
Ce qui l’est moins, c’est ce que la plupart des articles en ont retenu.
Ce que l’étude a réellement mesuré
L’essai est publié en octobre 2024 dans JAMA Network Open. Cinquante médecins de médecine interne, d’urgence et de médecine générale sont tirés au sort en deux groupes. Les uns disposent de leurs ressources habituelles — UpToDate, PubMed, Google. Les autres ont les mêmes ressources plus GPT‑4. Tous traitent les mêmes vignettes cliniques, 244 cas au total, notés selon une grille identique.
Résultat :
| Score médian de raisonnement diagnostique | |
|---|---|
| Médecin, ressources classiques | 74 % |
| Médecin + GPT‑4 | 76 % |
| GPT‑4 seul | 92 % |
L’écart entre les deux groupes de médecins est de 2 points, avec un intervalle de confiance qui va de −4 à +8 et un p à 0,60. En clair : rien. L’accès à GPT‑4 n’a rien apporté au praticien.
Pendant ce temps, le même modèle, livré à lui-même, dépasse les deux groupes de 16 points.
Une note au passage, qui dit quelque chose de l’écosystème : la quasi-totalité des articles français qui ont couvert cette étude annoncent 90 % pour GPT‑4 seul. Le papier dit 92 % (IQR 82‑97). Le chiffre faux s’est recopié de site en site pendant deux ans.
Le vrai problème n’était pas le modèle
Le réflexe, en 2024, a été d’y lire une leçon sur l’humain : le médecin ne fait pas confiance à la machine, il s’entête, il rejette l’avis qui contredit le sien.
C’est une explication. En voici une meilleure.
En mars 2026, une équipe de Stanford reprend exactement les mêmes vignettes, la même structure de cas et la même grille de notation. Soixante-dix cliniciens, 254 cas. La seule chose qui change, c’est la façon dont l’IA est branchée sur le raisonnement.
Au lieu de laisser un praticien discuter librement avec un chatbot, le système impose une séquence. Le clinicien et l’IA produisent chacun de leur côté un diagnostic. Ensuite seulement, l’IA génère une synthèse qui met en regard les deux analyses, pointe les accords, isole les désaccords et argumente pour et contre chaque hypothèse.
| Score moyen | |
|---|---|
| Médecin, ressources classiques | 75 % |
| Médecin + IA en second avis | 82 % |
| Médecin + IA en premier avis | 85 % |
| IA seule | 87 % |
Cette fois, l’écart est franc : +6,8 points (IC95 4,0 à 9,6) et +9,8 points (IC95 4,6 à 15,0), tous deux hautement significatifs.
Même famille de modèle. Mêmes cas. Mêmes correcteurs. Le gain apparaît quand on change le protocole, pas l’outil.
Une précision que presque personne ne fait
Il faut lire les auteurs jusqu’au bout. Ils écrivent que le premier avis ne diffère pas significativement du second (p = 0,22), ni de l’IA laissée seule (p = 0,20).
Autrement dit : ce qui est démontré, c’est que les deux protocoles collaboratifs battent les ressources classiques. Pas que l’ordre médecin/machine tranche quoi que ce soit. Toute page qui vous vend « faites parler l’IA en premier, c’est prouvé » sur-interprète l’essai.
Ce que ça change pour un manager
Aucune de ces études ne porte sur des managers. Le dire tout de suite évite de vous vendre une transposition pour une preuve. Mais le mécanisme mis au jour n’a rien de médical, et il décrit assez bien ce qui se passe dans un comité de direction.
Le mode par défaut est le pire. Ouvrir une conversation et demander « qu’en penses-tu ? » sur un arbitrage déjà formé, c’est exactement le dispositif de 2024 : celui qui n’apporte rien. C’est pourtant l’usage majoritaire.
La séquence vaut plus que le modèle. Formez votre avis, faites produire à l’IA le sien sans lui montrer le vôtre, puis demandez-lui la mise en regard des deux. Trois étapes, aucune compétence technique. C’est là qu’était le gain de sept à dix points.
La valeur est dans le désaccord. Le dispositif de 2026 ne cherche pas la bonne réponse, il cherche l’endroit où les deux analyses divergent. Une IA qui vous approuve ne vous a rien apporté — et elle le fait plus souvent que vous ne le croyez, sujet que nous traitons à part.
Deux garde-fous avant d’en tirer une politique
Une vignette n’est pas un patient. Cinq des six études de ce corpus portent sur des dossiers écrits, complets, traités au calme. Le seul grand essai mené sur de vrais patients — 16 centres au Kenya, plus de 9 600 patients, publié dans Nature Medicine en 2026 — conclut que l’outil est sûr et améliore la qualité des décisions, mais sans effet significatif sur l’issue à 14 jours. Un gain de score ne se convertit pas mécaniquement en bénéfice réel.
L’IA est mauvaise là où on la croit bonne. Une étude du Mass General Brigham parue en 2026 a passé 21 modèles au banc d’essai : ils trouvent le bon diagnostic final dans plus de 90 % des cas quand on leur donne le dossier complet, mais échouent à construire un différentiel pertinent dans plus de 80 % des cas. Ils savent trancher entre des hypothèses posées. Ils savent mal ouvrir le champ des hypothèses.
C’est exactement le partage des rôles à installer : à vous d’ouvrir le champ, à la machine de le passer au crible, à vous de trancher.
Le gain existe, il est mesuré, il vaut sept à dix points. Il ne s’obtient pas en achetant une licence. Il s’obtient en changeant trois gestes dans la façon de poser une question — ce que nous installons en deux jours dans nos formations.
Sources. Goh et al., JAMA Network Open 2024;7(10):e2440969 · Everett et al., npj Digital Medicine 2026 · Agweyu et al., Nature Medicine 2026 · JAMA Network Open 2026, doi:10.1001/jamanetworkopen.2026.4003