本文小节
一项发表于《科学》的研究称,大语言模型在五项高难度临床病例推理实验中,表现超过了由数百名医生构成的基线;研究还在一家大型三级学术医疗中心的急诊科,对随机选取患者比较了人类专家与 AI 给出的第二意见。研究作者的结论是,模型已超过多数临床推理基准,并因此需要开展紧迫的前瞻性试验。微软研究页面
这项结果能说明的是:在设定的临床推理任务及第二意见比较中,模型的表现高于研究中的医生基线。它不能仅凭这些结果推出 AI 已可独立承担诊断、治疗或随访责任;作者提出前瞻性试验,本身也表明模型性能并非临床验证的终点。
比较的是临床推理任务,不是完整诊疗流程
微软公布的论文介绍称,研究采用了复杂临床诊断推理病例——这类病例长期被用于评估专家医疗计算系统——并进行了五项实验。模型在全部实验中超过医生基线,也较此前几代临床决策支持 AI 有所提升。
但“超过医生基线”有明确的比较边界:它指向这项研究中的病例推理与意见比较,不能被扩大为对所有医生、所有专科或全部临床场景的结论。资料也没有报告 AI 独立接诊、检查、沟通、治疗与随访后的患者结局。
急诊分诊尤其能显示任务边界。《卫报》报道,AI 的优势在需要迅速决定、初始信息又有限的分诊情境中更为明显。《卫报》这支持了一个较窄的判断:模型在时间紧迫、线索有限的诊断推理任务中表现突出。至于这种表现进入日常工作流后能否稳定改善照护,现有材料并未给出答案。
急诊中的“第二意见”意味着什么
研究并未完全停留在病例库中。根据微软的论文介绍,团队还在一家大型三级学术医疗中心的急诊科,对随机选取患者比较了人类专家意见和 AI 的第二意见。
NPR 的报道提供了一个案例:一名肺栓塞患者起初好转后症状恶化,医疗团队怀疑药物没有起效;AI 在查阅病历后提出,患者的狼疮病史及其可能引起的心脏炎症,或许才是病情恶化的解释。报道称,模型的判断正确。
单一个案不能证明普遍效果,却具体呈现了“第二意见”的角色:模型可以重新整合已有资料,提出不同于初步判断的诊断假设。研究所显示的,是这种推理与复核能力在特定比较中优于医生基线,而不是软件已可取代对患者负责的临床决策。
从推理表现到临床部署,仍需前瞻性验证
论文介绍没有把高于医生基线的结果视为临床部署的结论。相反,作者认为模型超过多数临床推理基准,因而有必要紧迫地开展前瞻性试验。微软研究页面
因此,“AI 准确率”不应被简化为一次模型与医生的胜负。现有材料支持的结论是,AI 在临床推理比较和急诊第二意见中显示出较强表现;当这类意见进入真实医疗流程后,是否能在医生审查和后续决策中改善诊断与照护,仍是需要进一步检验的问题。