Los LLM de propósito general superan a las herramientas clínicas de IA especializadas y a los médicos en estudios comparativos

Los estudios comparativos muestran que los LLM de propósito general como GPT-5.2, Gemini 3.1 Pro y Claude Opus 4.6 superan a las herramientas clínicas de IA autorizadas por la FDA y a los médicos en tareas de razonamiento diagnóstico. Los LLM adaptados al dominio también superan a los modelos genéricos más grandes en tareas de investigación clínica, mientras que los sistemas agénticos muestran solo ganancias modestas. Las vías de autorización regulatoria aún no han abordado el rendimiento comparativo.

Estudios comparativos publicados en Nature Medicine y Science muestran que los grandes modelos de lenguaje (LLM) de propósito general superan tanto a las herramientas clínicas de IA autorizadas por la FDA como a los médicos en tareas de razonamiento diagnóstico y clínico basadas en casos. En un estudio comparativo de Nature Medicine publicado el 23 de junio de 2026, GPT-5.2 de OpenAI, Gemini 3.1 Pro de Google y Claude Opus 4.6 de Anthropic superaron a dos herramientas clínicas de IA especializadas, OpenEvidence y UpToDate Expert AI de Wolters Kluwer, en preguntas enviadas por médicos en ejercicio. Los modelos de propósito general ganaron en todos los benchmarks médicos evaluados, y ninguna de las herramientas autorizadas mantuvo una ventaja de rendimiento en consultas reales no estructuradas en el punto de atención.

Un estudio separado publicado en Science encontró que un gran modelo de lenguaje de OpenAI puede superar a los médicos en evaluaciones de razonamiento diagnóstico y clínico basadas en casos, incluido un experimento que utilizó datos reales de un departamento de emergencias de Boston. El coautor principal del artículo expresó su preocupación de que los experimentos, todos basados en casos simulados e históricos, pudieran malinterpretarse como prueba de la seguridad y eficacia de la IA cuando se utiliza para tratar pacientes reales.

Los resultados de Nature Medicine coinciden con un estudio anterior de julio de 2024 en el Journal of Medical Internet Research, en el que ChatGPT con GPT-4 superó a los médicos residentes del departamento de emergencias en precisión diagnóstica en 100 casos de emergencia de medicina interna, logrando una precisión superior en comparación tanto con GPT-3.5 como con los médicos humanos. Un recurso llamado TrialPanorama, descrito en npj Digital Medicine, agregó 1,6 millones de registros de ensayos clínicos de quince registros internacionales y construyó 152 000 muestras de entrenamiento y prueba que abarcan ocho tareas de investigación clínica. La evaluación comparativa de los LLM de vanguardia en estas tareas reveló una capacidad limitada de razonamiento clínico en los LLM genéricos, pero un LLM de 8B desarrollado en TrialPanorama mediante ajuste fino supervisado y aprendizaje por refuerzo superó a sus homólogos genéricos de 70B en las ocho tareas, con mejoras relativas del 73,7 %, 67,6 %, 38,4 %, 37,8 %, 26,5 %, 20,7 %, 20,0 %, 18,1 % y 5,2 %.

La evaluación comparativa de los sistemas de IA agénticos para tareas de decisión clínica encontró ganancias más modestas. Un estudio evaluó el OpenManus de código abierto, construido sobre Llama-4 de Meta y ampliado con agentes médicos personalizados, y Manus, un sistema de agente propietario que emplea una arquitectura de planificador-ejecutor-verificador de múltiples pasos, en AgentClinic, MedAgentsBench y Humanity's Last Exam (HLE). A pesar del acceso a herramientas como navegación web y ejecución de código, los sistemas alcanzaron el 60,3 % y el 28,0 % en AgentClinic MedQA y MIMIC, el 30,3 % en MedAgentsBench y el 8,6 % en HLE text, con una precisión multimodal tan baja como el 15,5 % en HLE multimodal y el 29,2 % en AgentClinic NEJM. Las demandas de recursos aumentaron sustancialmente, con más de 10 veces el uso de tokens y más de 2 veces la latencia, y aunque el 89,9 % de las alucinaciones fueron filtradas por salvaguardas internas del agente, las alucinaciones siguieron siendo prevalentes.

La brecha de rendimiento entre las herramientas autorizadas y las no autorizadas plantea cuestiones regulatorias. Un estudio transversal analizado en JAMA Health Forum examinó 691 dispositivos de IA y aprendizaje automático autorizados por la FDA entre septiembre de 1995 y julio de 2023; solo el 1,6 % de esos dispositivos informó datos de ensayos controlados aleatorizados en su documentación de beneficio-riesgo antes de la autorización, y menos del 30 % compartió información clave sobre seguridad y eventos adversos antes de la aprobación. La FDA emitió una guía revisada sobre software de soporte de decisiones clínicas el 29 de enero de 2026, reemplazando la versión anterior del 28 de septiembre de 2022, y su guía final del 4 de diciembre de 2024 sobre Planes de Control de Cambios Predeterminados (PCCP) para funciones de software de dispositivos habilitadas para IA requiere que los patrocinadores preespecifiquen los tipos de cambios y los protocolos de prueba. Una carta de advertencia del 10 de febrero de 2025 a Exer Labs por su herramienta de diagnóstico Exer Scan AI ilustra la aplicación centrada en herramientas comercializadas sin autorización.

La adopción de la IA en la práctica clínica ya está generalizada: la encuesta de IA para médicos de 2024 de la AMA encontró que el 66 % de los médicos utilizan actualmente la IA en la práctica, frente al 38 % en 2023, y el 68 % informó percibir una clara ventaja de las herramientas de IA. El documento de reflexión de 2024 de la EMA sobre IA/ML en el desarrollo clínico adoptó un enfoque basado en el riesgo, y las herramientas de alto riesgo que podrían influir en los criterios de valoración primarios de los ensayos o en la notificación de seguridad se enfrentan a un escrutinio más estricto, incluidos requisitos de monitoreo prospectivo del rendimiento. La evaluación global de adopción de IA de 2024 del Centro Tufts para el Estudio del Desarrollo de Medicamentos, realizada con la Asociación de Información de Medicamentos entre mayo y agosto de 2024, encontró que la adopción de soluciones habilitadas para IA en el desarrollo clínico se está acelerando rápidamente a pesar de la ausencia de puntos de referencia de rendimiento estandarizados entre los proveedores.

Related Entities

Related Articles

References

  1. Benchmarking and developing large language models using one million clinical trials · nature.com
  2. Nature Medicine's June 2026 Benchmark Study Reveals General-Purpose LLMs ... · clinicaltrialvanguard.com
  3. The Specialized Clinical AI Trap: General-Purpose Chatbots Are Winning the Benchmark War · clinicaltrialvanguard.com
  4. Clinical large language model centered on electronic medical records | npj Digital Medicine · nature.com
  5. Large Language Model–Generated Patient Instructions for Prescriptions in Primary Health Care · jmir.org
  6. As artificial intelligence show off diagnostic chops, scientists reckon with the way forward · statnews.com
  7. Benchmarking large language model-based agent systems for clinical decision tasks · nature.com