Todas las entradas

IA vs médicos: qué muestran los estudios

Casi todos los estudios que reportan que la IA superó a los médicos comparan un algoritmo en una tarea muy acotada contra clínicos que reciben exactamente la misma información limitada: un conjunto seleccionado de imágenes o un bloque de texto. En esas condiciones, la IA suele igualar o superar a los especialistas, y lo viene haciendo desde 2016. En las condiciones en las que un médico trabaja de verdad, o sea tomar una historia clínica, revisar al paciente, decidir qué hacer cuando faltan datos y cargar con las consecuencias de equivocarse, la comparación casi no se ha hecho.

Qué compara en realidad un estudio de "IA vs médicos"

Casi todos los titulares que viste salen de uno de tres diseños. Un estudio retrospectivo sobre una base de datos pasa el modelo por imágenes o registros guardados con una respuesta ya conocida. Un estudio de lectores entrega esos mismos casos guardados a un panel pequeño de clínicos y compara puntajes. Un ensayo prospectivo mete el sistema en un flujo clínico real y mide qué le pasa a los pacientes. Los dos primeros son comunes y baratos. El tercero es raro y caro, y es el único que dice algo sobre la práctica real.

La distancia entre esos diseños está documentada. En una revisión sistemática de 2019 en The Lancet Digital Health, Liu y colegas revisaron más de veinte mil trabajos sobre deep learning en imagenología médica y encontraron que apenas un puñado, menos de veinte, comparaban el algoritmo con profesionales de la salud sobre la misma muestra de prueba. En esos casos el desempeño fue en general parecido. Una revisión de 2020 en el BMJ, de Nagendran y colegas, miró esa misma literatura y concluyó que los ensayos aleatorizados eran casi inexistentes, que la mayoría de los estudios tenía alto riesgo de sesgo y que las afirmaciones del resumen iban bastante más lejos que los datos de las tablas.

Así que cuando leas "la IA superó a los médicos", la traducción honesta suele ser "en esta base de datos, contra esta cantidad de lectores, en esta única tarea".

Frente a frente, tarea por tarea

Tarea Mejor evidencia a favor de la IA Dónde el clínico sigue arriba
Retinopatía diabética en fotos de retina Gulshan et al., JAMA 2016: sensibilidad y especificidad iguales o superiores a un panel de oftalmólogos en los conjuntos de validación Decidir qué sigue para un paciente cuya imagen no se puede evaluar o que no tiene cómo llegar a una clínica
Clasificación de lesiones de piel Esteva et al., Nature 2017: una red neuronal igualó a dermatólogos certificados en conjuntos de imágenes seleccionadas Lesiones en tonos de piel, zonas del cuerpo y cámaras poco representadas en el entrenamiento
Tamizaje mamográfico McKinney et al., Nature 2020: menos falsos positivos y falsos negativos que los lectores, con datos retrospectivos de Reino Unido y Estados Unidos Programas de tamizaje en vivo, donde el modelo se topa con una población en la que nunca fue validado
Conversación diagnóstica por texto El estudio AMIE de Google en Nature: mayor precisión diagnóstica que médicos de primer nivel en un estudio aleatorizado con pacientes simulados por chat Cualquier consulta que requiera exploración física, o un paciente real que omite justo el dato que importa
Razonamiento diagnóstico con un LLM de apoyo Goh et al., JAMA Network Open 2024: el modelo trabajando solo puntuó más alto que los médicos Los médicos con el modelo no superaron con claridad a los médicos con recursos convencionales

Esa última fila es el resultado más interesante de la tabla y el menos comentado. Si el modelo solo le gana a los médicos, y los médicos con el modelo no le ganan a los médicos solos, entonces el cuello de botella no es la precisión en bruto. Es cómo decide un clínico cuándo aceptar una respuesta que no produjo él.

Dónde el clínico sigue claramente por delante

Los casos que nunca estuvieron en los datos. El desempeño de un modelo es una propiedad de su distribución de entrenamiento. Cámbialo a otro equipo, a otra población o a una prevalencia de enfermedad que nunca vio, y la precisión puede caerse sin ninguna señal de alerta. Los clínicos se degradan de forma más elegante, porque notan que algo les resulta desconocido y lo derivan.

Todo lo que pasa antes de que exista la imagen. Alguien decidió que este paciente necesitaba un estudio, que ese dolor de pecho valía la pena investigarlo esta misma noche. Ese paso de triage es la mayor parte de la medicina, y es justo la parte que los benchmarks se saltan.

El modelo no aprende de tu caso. Un sistema diagnóstico ya desplegado corre inferencia con pesos congelados. No recuerda al paciente que vio en la mañana ni se actualiza cuando se equivoca, que es exactamente lo contrario de cómo un clínico construye criterio a lo largo de una carrera. Si esa distinción te queda borrosa, vale la pena entender qué cambia entre aprendizaje e inferencia antes de leer otra afirmación de desempeño.

Reproducibilidad. El trabajo de 2020 sobre tamizaje de cáncer de mama recibió una respuesta formal en Nature, de Haibe-Kains y colegas, que argumentaba que sin código publicado ni detalles del modelo el resultado no se podía verificar de forma independiente. Esa objeción aplica a buena parte de la literatura.

Responsabilidad. Ningún estudio ha producido todavía un sistema al que se le pueda pedir cuentas por un resultado.

En cuál confiar, y para qué

Para tamizaje de alto volumen de una señal única y bien definida, sobre datos que se parecen a los datos con los que el modelo fue validado, la evidencia a favor de la IA es genuinamente sólida, y una segunda lectura automatizada puede atrapar lo que un ojo humano cansado dejó pasar a las cuatro de la tarde en el estudio número cuarenta del día.

Para un problema indiferenciado, de esos que llegan como "hace tres semanas que me siento mal", la evidencia favorece al clínico, y no por poco. Nada en la literatura actual pone a prueba un modelo frente al trabajo completo.

Para tu propia salud, el médico es quien puede revisarte, pedir el estudio y darle seguimiento al resultado. Un chatbot te puede ayudar a ordenar preguntas antes de la consulta. No reemplaza la consulta, y leer el resumen de un estudio como permiso para no ir es el error más caro disponible aquí.

Cómo leer el próximo titular

  1. Ubica la tarea. ¿Una enfermedad, una modalidad, una decisión binaria? Entonces la afirmación es sobre eso, no sobre la medicina.
  2. Ubica el grupo de comparación. Seis lectores en un estudio de lectores no son "los médicos".
  3. Pregunta si los humanos tenían la misma información. Radiólogos que leen imágenes sin historia clínica están trabajando con una mano atada.
  4. Busca validación externa. Si el modelo nunca se probó con datos de una institución ajena al conjunto de entrenamiento, ese número es un techo, no un pronóstico.

Si eres estudiante y estos son tus papers

Leer una sección de métodos no es lo mismo que poder reconstruir el argumento en un examen tres semanas después. En los experimentos de Roediger y Karpicke de 2006, los estudiantes que se autoevaluaron sobre el material retuvieron bastante más que los que lo releyeron, aunque releer se sintiera más productivo en el momento. La versión práctica es cerrar el paper y escribir de memoria qué se comparó y cuál era la limitación. Convertir tus propios apuntes de clase y tus lecturas en preguntas que tienes que responder es el mismo mecanismo aplicado a escala, ya sea que lo hagas armando un examen de práctica a mano o con una herramienta como Qora que genera preguntas a partir del material que de verdad estudiaste y no de un banco genérico de preguntas.

Preguntas frecuentes

¿La IA de verdad le ha ganado a los médicos en algún estudio?

Sí, en varios, en tareas muy acotadas. Detección de retinopatía diabética, clasificación de lesiones de piel y tamizaje mamográfico tienen resultados publicados donde el modelo igualó o superó al grupo de clínicos con el que se comparó. Todos fueron sobre conjuntos de datos seleccionados, y la mayoría fueron retrospectivos.

¿Esos resultados se sostienen en hospitales reales?

Muchas veces no al mismo nivel. Las revisiones de The Lancet Digital Health y del BMJ coincidieron en que los ensayos prospectivos son raros y que la mayoría de las comparaciones publicadas tiene alto riesgo de sesgo. El desempeño medido sobre un conjunto de prueba curado es el mejor escenario, no el esperado.

¿La IA puede reemplazar a los médicos?

Con la evidencia actual no, y el resultado más revelador es el ensayo aleatorizado de 2024 donde los médicos con un LLM no superaron con claridad a los médicos usando recursos convencionales, aunque el modelo puntuara más alto por su cuenta. Integrar esto al trabajo clínico es un problema sin resolver, y es distinto del problema de la precisión.

¿Conviene usar un chatbot de IA para mis síntomas?

Es razonable para entender terminología, preparar preguntas o darle sentido a un reporte que ya tienes. No es un diagnóstico, no puede revisarte y no tiene forma de saber qué es lo que no sabe sobre tu caso.

La versión corta: la IA ha ganado de verdad en tareas diagnósticas específicas y bien delimitadas, y esas victorias son reales y útiles. Lo que no se ha demostrado es superioridad en el trabajo completo, porque el trabajo incluye justo las partes que los estudios dejan fuera. La próxima vez que un resultado te pase por el feed, busca tres cosas antes de formarte una opinión: qué tarea única se midió, sobre los datos de quién se midió, y cuántos clínicos estaban del otro lado de la comparación.