通用大语言模型在基准研究中胜过专科临床AI工具和医生
基准研究显示,GPT-5.2、Gemini 3.1 Pro和Claude Opus 4.6等通用大语言模型在诊断推理任务上优于获FDA批准的临床AI工具和医生。领域自适应LLM在临床研究任务上也胜过更大的通用模型,而智能体系统仅展现出有限的进步。监管批准途径尚未解决比较性能问题。
发表在《Nature Medicine》和《Science》上的头对头研究表明,在基于病例的诊断和临床推理任务中,通用大语言模型(LLM)的表现优于已获FDA批准的临床AI工具和医生。《Nature Medicine》于2026年6月23日发表的基准测试显示,OpenAI的GPT-5.2、谷歌的Gemini 3.1 Pro和Anthropic的Claude Opus 4.6在执业医生提交的问题上优于两款专科临床AI工具——OpenEvidence和Wolters Kluwer的UpToDate Expert AI。通用模型在所有测试的医学基准中都取得了胜利,且这两款已获批工具在处理真实世界非结构化临床即时查询时均未表现出性能优势。
《Science》上发表的另一项研究发现,OpenAI的一个大语言模型在基于病例的诊断和临床推理评估中可胜过医生,其中一项实验使用了波士顿急诊科的真实世界数据。该论文的共同资深作者担心,这些基于模拟和既往病例的实验可能会被误解为AI在治疗真实患者时安全有效的证据。
《Nature Medicine》的结果与此前2024年7月发表在《Journal of Medical Internet Research》上的一项研究一致。该研究显示,使用GPT-4的ChatGPT在100个内科急诊病例中的诊断准确率优于急诊科住院医师,且准确率高于GPT-3.5和人类医生。
《npj Digital Medicine》描述的资源TrialPanorama整合了来自15个全球注册机构的160万条临床试验记录,构建了涵盖8项临床研究任务的15.2万条训练和测试样本。对前沿LLM在这些任务上的基准测试显示,通用LLM的临床推理能力有限,但在TrialPanorama上通过监督微调和强化学习开发的8B LLM在所有8项任务中均优于70B通用模型,相对改进幅度分别为73.7%、67.6%、38.4%、37.8%、26.5%、20.7%、20.0%、18.1%和5.2%。
对临床决策任务的智能体AI系统的基准测试发现,性能提升较为有限。一项研究评估了开源OpenManus(基于Meta的Llama-4构建并扩展了医学定制智能体)和Manus(采用多步骤规划器-执行器-验证器架构的专有智能体系统)在AgentClinic、MedAgentsBench和Humanity's Last Exam(HLE)上的表现。尽管能够使用网页浏览和代码执行等工具,这些系统在AgentClinic MedQA和MIMIC上分别达到60.3%和28.0%,在MedAgentsBench上为30.3%,在HLE文本上为8.6%;多模态HLE的准确率低至15.5%,AgentClinic NEJM为29.2%。资源需求大幅增加,token使用量超过10倍,延迟超过2倍。尽管89.9%的幻觉被智能体内防护机制过滤,但幻觉仍然普遍存在。
已获批和未获批工具之间的性能差距引发了监管问题。《JAMA Health Forum》上分析的一项横断面研究检查了1995年9月至2023年7月期间FDA批准的691种AI和机器学习设备;其中仅有1.6%的设备在批准前的获益-风险文档中报告了随机对照试验数据,不到30%的设备在批准前分享了关键安全性和不良事件信息。FDA于2026年1月29日发布了修订后的临床决策支持软件指南,取代了2022年9月28日的版本;其2024年12月4日关于AI辅助设备软件功能的预定变更控制计划(PCCPs)最终指南要求申办方预先规定变更类型和测试方案。2025年2月10日针对Exer Labs的Exer Scan AI诊断工具发出的警告信表明执法重点针对未经许可上市的器械。
AI在临床实践中的应用已十分普遍:AMA的2024年医生AI调查发现,66%的医生目前在临床实践中使用AI,高于2023年的38%,68%的医生表示感知到AI工具的明确优势。EMA关于临床开发中AI/ML的2024年反思文件采用了风险分级方法,对可能影响试验主要终点或安全性报告的高风险工具加强了审查,包括前瞻性绩效监测要求。塔夫茨药物开发研究中心与药物信息协会于2024年5月至8月开展的2024年全球AI应用评估发现,尽管各供应商之间缺乏标准化性能基准,临床开发中AI赋能的解决方案的应用正在快速加速。