前沿大语言模型在肿瘤学决策中的集体能力边界:符合指南与个体化诊疗的挑战
这项研究聚焦一个关键问题:大语言模型在标准化医学考试中的高光表现,能否转化为真实肿瘤诊疗中的可靠决策能力?研究者没有停留在知识问答层面,而是设计了符合临床指南且针对具体病例的决策任务,模拟医生在实际工作中需要连续判断、权衡治疗方案的过程。结果显示,尽管单个模型在知识测试中表现优异,但当任务转向需要结合患者个体情况、遵循指南并做出序列化决策时,前沿模型的集体能力出现明显边界——没有模型能稳定达到临床可用标准,且不同模型间的错误模式高度相关。这项工作的价值在于提醒AI社区:医学AI的评估不能依赖静态考题,而应构建更贴近真实临床场景的动态、情境化基准。它也间接指出,仅靠扩大模型规模或堆叠多个模型,可能难以突破这一集体性局限,未来需要新的训练目标或推理框架,才能让大语言模型真正安全地辅助肿瘤学决策。
本文来源:arXiv cs.AI
阅读原文 ↗