LLMs de propósito geral superam ferramentas clínicas de IA especializadas e médicos em estudos de benchmark

Estudos de benchmark mostram que LLMs de propósito geral como GPT-5.2, Gemini 3.1 Pro e Claude Opus 4.6 superam ferramentas clínicas de IA aprovadas pela FDA e médicos em tarefas de raciocínio diagnóstico. LLMs adaptadas a domínios específicos também superam modelos genéricos maiores em tarefas de pesquisa clínica, enquanto sistemas agênticos apresentam apenas ganhos modestos. Os caminhos de autorização regulatória ainda não abordaram o desempenho comparativo.

Estudos comparativos publicados na Nature Medicine e na Science mostram que modelos de linguagem de grande porte (LLMs) de propósito geral superam tanto ferramentas clínicas de IA aprovadas pela FDA quanto médicos em tarefas de raciocínio diagnóstico e clínico baseadas em casos. Em um benchmark da Nature Medicine publicado em 23 de junho de 2026, o GPT-5.2 da OpenAI, o Gemini 3.1 Pro do Google e o Claude Opus 4.6 da Anthropic superaram duas ferramentas clínicas de IA especializadas, OpenEvidence e UpToDate Expert AI da Wolters Kluwer, em perguntas enviadas por médicos em exercício. Os modelos de propósito geral venceram em todos os benchmarks médicos testados, e nenhuma das ferramentas aprovadas teve vantagem de desempenho em consultas reais e não estruturadas no ponto de atendimento.

Um estudo separado publicado na Science descobriu que um modelo de linguagem de grande porte da OpenAI pode superar médicos em avaliações de raciocínio diagnóstico e clínico baseadas em casos, incluindo um experimento que usou dados reais de um pronto-socorro de Boston. O coautor sênior do artigo expressou preocupação de que os experimentos, todos baseados em casos simulados e históricos, pudessem ser mal interpretados como prova da segurança e eficácia da IA quando usada para tratar pacientes reais.

Os resultados da Nature Medicine estão alinhados com um estudo anterior de julho de 2024 publicado no Journal of Medical Internet Research, no qual o ChatGPT com GPT-4 superou médicos residentes de emergência em precisão diagnóstica em 100 casos de emergência em medicina interna, alcançando precisão superior em comparação tanto com o GPT-3.5 quanto com os médicos humanos. Um recurso chamado TrialPanorama, descrito no npj Digital Medicine, agregou 1,6 milhão de registros de ensaios clínicos de quinze registros globais e construiu 152 mil amostras de treinamento e teste em oito tarefas de pesquisa clínica. A avaliação de LLMs de ponta nessas tarefas revelou capacidade limitada de raciocínio clínico em LLMs genéricas, mas um LLM de 8B desenvolvido no TrialPanorama com ajuste fino supervisionado e aprendizado por reforço superou os equivalentes genéricos de 70B em todas as oito tarefas, com melhorias relativas de 73,7%, 67,6%, 38,4%, 37,8%, 26,5%, 20,7%, 20,0%, 18,1% e 5,2%.

A avaliação de sistemas de IA agênticos para tarefas de decisão clínica encontrou ganhos mais modestos. Um estudo avaliou o OpenManus de código aberto, construído sobre o Llama-4 da Meta e estendido com agentes personalizados para a área médica, e o Manus, um sistema agêntico proprietário que usa uma arquitetura de planejador-executor-verificador em múltiplas etapas, em AgentClinic, MedAgentsBench e Humanity's Last Exam (HLE). Apesar do acesso a ferramentas como navegação na web e execução de código, os sistemas alcançaram 60,3% e 28,0% no AgentClinic MedQA e MIMIC, 30,3% no MedAgentsBench e 8,6% no texto do HLE, com precisão multimodal tão baixa quanto 15,5% no HLE multimodal e 29,2% no AgentClinic NEJM. As demandas de recursos aumentaram substancialmente, com uso de tokens mais de 10 vezes maior e latência mais de 2 vezes superior, e embora 89,9% das alucinações tenham sido filtradas pelas salvaguardas internas dos agentes, as alucinações continuaram prevalentes.

A diferença de desempenho entre ferramentas aprovadas e não aprovadas levanta questões regulatórias. Um estudo transversal analisado no JAMA Health Forum examinou 691 dispositivos de IA e aprendizado de máquina aprovados pela FDA entre setembro de 1995 e julho de 2023; apenas 1,6% desses dispositivos relataram dados de ensaios clínicos randomizados em sua documentação de risco-benefício antes da aprovação, e menos de 30% compartilharam informações importantes sobre segurança e eventos adversos antes da autorização. A FDA emitiu uma orientação revisada sobre software de Suporte à Decisão Clínica em 29 de janeiro de 2026, substituindo a versão anterior de 28 de setembro de 2022, e sua orientação final de 4 de dezembro de 2024 sobre Planos de Controle de Mudanças Pré-determinadas (PCCPs) para funções de software de dispositivos habilitados por IA exige que os patrocinadores pré-especifiquem os tipos de mudanças e protocolos de teste. Uma carta de advertência de 10 de fevereiro de 2025 enviada à Exer Labs por sua ferramenta diagnóstica de IA Exer Scan ilustra a fiscalização focada em ferramentas comercializadas sem aprovação.

A adoção da IA na prática clínica já é generalizada: a pesquisa de 2024 da AMA sobre IA para médicos constatou que 66% dos médicos usam IA na prática atualmente, ante 38% em 2023, e 68% relataram perceber vantagem definitiva nas ferramentas de IA. O documento de reflexão de 2024 da EMA sobre IA/ML no desenvolvimento clínico adotou uma abordagem em níveis de risco, com ferramentas de alto risco que podem influenciar os desfechos primários de ensaios ou a notificação de segurança sujeitas a um escrutínio mais rigoroso, incluindo requisitos de monitoramento prospectivo de desempenho. A avaliação global de 2024 sobre adoção de IA do Tufts Center for the Study of Drug Development, realizada com a Drug Information Association entre maio e agosto de 2024, constatou que a adoção de soluções habilitadas por IA no desenvolvimento clínico está acelerando rapidamente, apesar da ausência de benchmarks de desempenho padronizados entre fornecedores.

Related Entities

Related Articles

References

  1. Benchmarking and developing large language models using one million clinical trials · nature.com
  2. Nature Medicine's June 2026 Benchmark Study Reveals General-Purpose LLMs ... · clinicaltrialvanguard.com
  3. The Specialized Clinical AI Trap: General-Purpose Chatbots Are Winning the Benchmark War · clinicaltrialvanguard.com
  4. Clinical large language model centered on electronic medical records | npj Digital Medicine · nature.com
  5. Large Language Model–Generated Patient Instructions for Prescriptions in Primary Health Care · jmir.org
  6. As artificial intelligence show off diagnostic chops, scientists reckon with the way forward · statnews.com
  7. Benchmarking large language model-based agent systems for clinical decision tasks · nature.com