Todas as publicações

IA vs médicos: o que os estudos mostram

A maioria dos estudos que anuncia a IA superando médicos compara um algoritmo em uma tarefa estreita contra profissionais que recebem exatamente a mesma entrada limitada, quase sempre um conjunto selecionado de imagens ou um bloco de texto. Nessas condições, a IA costuma empatar ou superar especialistas, e isso vem se repetindo desde 2016. Nas condições em que um médico trabalha de verdade, colhendo anamnese, examinando o paciente, decidindo o que fazer quando os dados estão incompletos e carregando a consequência de estar errado, a comparação quase nunca foi feita.

O que um estudo de "IA vs médicos" compara de fato

Quase toda manchete que você viu vem de um de três desenhos. Um estudo retrospectivo de base de dados roda o modelo sobre imagens ou prontuários armazenados cuja resposta já é conhecida. Um reader study entrega os mesmos casos armazenados a um pequeno painel de médicos e compara as pontuações. Um ensaio prospectivo coloca o sistema dentro do fluxo clínico real e mede o que acontece com os pacientes. Os dois primeiros são comuns e baratos. O terceiro é raro e caro, e é o único que diz alguma coisa sobre a prática de verdade.

Essa distância entre os desenhos está documentada. Em uma revisão sistemática de 2019 no The Lancet Digital Health, Liu e colaboradores triaram mais de vinte mil artigos sobre aprendizado profundo em imagem médica e encontraram apenas um punhado, menos de vinte, que comparavam o algoritmo e profissionais de saúde na mesma amostra de teste. Nos que faziam isso, o desempenho era, em linhas gerais, parecido. Uma revisão de 2020 no BMJ, de Nagendran e colaboradores, olhou a mesma literatura e concluiu que ensaios randomizados eram praticamente inexistentes, que a maior parte dos estudos tinha alto risco de viés e que as afirmações dos resumos corriam na frente da evidência que estava nas tabelas.

Ou seja: quando você lê "IA superou médicos", a tradução honesta costuma ser "nesta base de dados, contra este número de leitores, nesta única tarefa".

Lado a lado, tarefa por tarefa

Tarefa Melhor evidência a favor da IA Onde o médico segue na frente
Retinopatia diabética em retinografias Gulshan et al., JAMA 2016: sensibilidade e especificidade iguais ou acima de um painel de oftalmologistas nos conjuntos de validação Decidir o próximo passo para o paciente cuja imagem não dá para avaliar ou que não consegue chegar a um serviço de saúde
Classificação de lesões de pele Esteva et al., Nature 2017: uma rede neural empatou com dermatologistas certificados em conjuntos de imagens selecionadas Lesões em tons de pele, regiões do corpo e câmeras pouco representados nos dados de treino
Rastreamento por mamografia McKinney et al., Nature 2020: menos falsos positivos e falsos negativos que os leitores em dados retrospectivos do Reino Unido e dos EUA Programas de rastreamento reais, em que o modelo encontra uma população na qual nunca foi validado
Conversa diagnóstica por texto Estudo AMIE, do Google, na Nature: acurácia diagnóstica maior que a de médicos de atenção primária em um estudo randomizado com pacientes simulados por chat Qualquer atendimento que exija exame físico, ou um paciente real que omite justamente o detalhe que importa
Raciocínio diagnóstico com apoio de um LLM Goh et al., JAMA Network Open 2024: o modelo sozinho pontuou mais que os médicos Médicos com acesso ao modelo não superaram com clareza médicos usando recursos convencionais

Essa última linha é o resultado mais interessante da tabela e o menos noticiado. Se o modelo sozinho ganha dos médicos, e médicos com o modelo não ganham dos médicos sozinhos, então o gargalo não é acurácia bruta. É como o profissional decide quando aceitar uma resposta que não foi ele quem produziu.

Onde o médico ainda está claramente à frente

Casos que nunca estiveram nos dados. O desempenho de um modelo é uma propriedade da distribuição em que ele treinou. Mude o aparelho, a população ou a prevalência da doença para algo que ele nunca viu, e a acurácia pode cair sem nenhum sinal de alerta. O médico se degrada de forma mais suave, porque percebe que algo ali é estranho e escala o caso.

Tudo que acontece antes de a imagem existir. Alguém decidiu que este paciente precisava de um exame, que esta dor no peito valia investigação hoje à noite. Essa etapa de triagem é a maior parte da medicina, e é justamente a parte que os benchmarks pulam.

O modelo não aprende com o seu caso. Um sistema diagnóstico em produção está rodando inferência sobre pesos congelados. Ele não se lembra do paciente que viu de manhã e não se atualiza quando erra, o que é exatamente o oposto de como um médico constrói julgamento ao longo de uma carreira. Se essa distinção ainda está nebulosa, vale entender o que muda entre aprendizado e inferência antes de ler a próxima promessa de desempenho.

Reprodutibilidade. O artigo de 2020 sobre rastreamento de câncer de mama recebeu uma resposta formal na Nature, de Haibe-Kains e colaboradores, argumentando que, sem código e detalhes do modelo publicados, o resultado não podia ser verificado de forma independente. Essa objeção vale para boa parte da literatura.

Responsabilização. Nenhum estudo produziu até hoje um sistema que possa ser responsabilizado por um desfecho.

Em quem confiar, e para quê

Para rastreamento em grande volume de um sinal único e bem definido, em dados parecidos com aqueles em que o modelo foi validado, a evidência a favor da IA é sólida de verdade, e uma segunda leitura automatizada pode pegar o que o olho cansado deixou passar às quatro da tarde, no quadragésimo exame do dia.

Para um problema indiferenciado, do tipo que chega como "faz três semanas que eu não estou bem", a evidência favorece o médico, e não por pouco. Nada na literatura atual testa um modelo no trabalho completo.

Para a sua saúde, o médico é quem pode te examinar, pedir o exame e acompanhar o resultado. Um chatbot ajuda a organizar as perguntas antes da consulta. Ele não substitui a consulta, e ler o resumo de um estudo como autorização para pular a consulta é o erro mais caro disponível aqui.

Como ler a próxima manchete

  1. Ache a tarefa. Uma doença, um tipo de exame, uma decisão de sim ou não? Então a afirmação é sobre isso, não sobre medicina.
  2. Ache o grupo de comparação. Seis leitores em um reader study não são "os médicos".
  3. Pergunte se os humanos tinham a mesma informação. Radiologista lendo imagem sem a história clínica está trabalhando com uma mão amarrada.
  4. Procure validação externa. Se o modelo nunca foi testado em dados de uma instituição fora do conjunto de treino, o número é um teto, não uma previsão.

Se você é o estudante que lê esses artigos

Ler uma seção de métodos não é a mesma coisa que conseguir reconstruir o argumento em uma prova três semanas depois. Nos experimentos de Roediger e Karpicke, de 2006, os estudantes que se testaram sobre o material retiveram bem mais do que os que releram, mesmo que reler parecesse mais produtivo na hora. A versão prática disso é fechar o artigo e escrever, de memória, o que foi comparado e qual era a limitação. Transformar suas próprias anotações de aula e seus artigos em perguntas que você precisa responder é o mesmo mecanismo aplicado em escala, seja montando um simulado na mão ou com uma ferramenta como o Qora, que gera perguntas a partir do material que você realmente estudou, e não de um banco de questões genérico.

Perguntas comuns

A IA já superou médicos em algum estudo?

Sim, em vários, sempre em tarefas estreitas. Detecção de retinopatia diabética, classificação de lesões de pele e rastreamento por mamografia têm resultados publicados em que o modelo empatou ou superou o grupo de comparação clínico. Todos usaram bases de dados selecionadas, e a maioria era retrospectiva.

Esses resultados se mantêm em hospitais de verdade?

Muitas vezes não no mesmo nível. Revisões no The Lancet Digital Health e no BMJ encontraram poucos ensaios prospectivos e alto risco de viés na maior parte das comparações publicadas. Desempenho medido em conjunto de teste selecionado é o melhor cenário, não o cenário esperado.

A IA pode substituir médicos?

Não pela evidência atual, e o resultado mais revelador é o ensaio randomizado de 2024 em que médicos com acesso a um LLM não superaram com clareza médicos usando recursos convencionais, mesmo com o modelo pontuando mais sozinho. Integrar a ferramenta ao trabalho clínico é um problema em aberto, separado da questão da acurácia.

Devo usar um chatbot de IA para sintomas?

Faz sentido para entender terminologia, preparar perguntas ou dar sentido a um laudo que você já tem em mãos. Não é diagnóstico, ele não pode te examinar e não tem como saber o que ele não sabe sobre o seu caso.

Resumindo: a IA venceu de verdade em tarefas diagnósticas específicas e bem delimitadas, e essas vitórias são reais e úteis. O que não foi demonstrado é superioridade no trabalho inteiro, porque o trabalho inclui justamente as partes que os estudos deixam de fora. Da próxima vez que um resultado aparecer no seu feed, procure três coisas antes de formar opinião: qual tarefa única foi medida, em dados de quem ela foi medida, e quantos médicos estavam do outro lado da comparação.