CDPR:基于反事实优势的代价感知顺序医疗诊断信用分配方法
临床诊断往往是一个逐步推进且需权衡成本的过程:医生每次选择一项检查,观察结果后再决定下一步,最终形成诊断。然而,传统强化学习模型在优化这一流程时,常面临奖励稀疏或信用分配模糊的问题——即难以判断哪一步检查对最终正确诊断贡献最大,导致模型冗余地安排不必要的检查,增加患者费用和医疗负担。
针对这一问题,研究者提出了一种名为CDPR的信用分配方法。其核心思想是利用反事实优势估计,为诊断步骤中每个动作的贡献进行更合理的归因。该方法能够明确区分“做了某项检查”与“假如不做”之间的结果差异,从而更精准地训练智能体在保证诊断准确性的同时减少检查开销。
这项工作的价值在于,它从强化学习算法层面切入医疗决策支持,既关注诊断效果,也强调代价控制。通过在公开医疗数据集上的实验,CDPR展现了优于现有基准的性能,为构建更高效、更经济的智能辅助诊断系统提供了新思路,尤其对医疗资源紧张的国家和地区具有现实意义。
本文来源:arXiv cs.AI
阅读原文 ↗