面向临床诊断的人类可解释人工智能:通过强化学习实现人类兼容推理的基础模型
人工智能
2026-03-03 v2
摘要
人工智能在医学诊断中的临床应用严重受到黑箱特性的制约,这阻碍了医生验证自动化决策背后的依据。为克服这一根本性障碍,我们引入 DeepMedix-R1,这是一个用于胸部X光(CXR)解释的基础模型(FM),不仅能生成准确诊断,还能生成基于特定视觉证据的透明、逐步推理过程。我们的 methodology 采用顺序训练策略,首先进行指令微调,然后进行冷启动阶段以激发推理能力。关键的是,我们随后实施基于 grounding rewards 的强化学习,以细致地校准模型,使其诊断输出和推理路径都与临床可信度相吻合。定量评估表明,DeepMedix-R1 在报告生成和视觉问答任务方面显著优于先进的基础模型,取得显著提升。我们还引入 Report Arena,这是一个新颖的基于大语言模型的基准,排名第一位的 DeepMedix-R1 在输出质量方面领先于竞争模型。最重要的是,临床专家的正式审查显示,对于 DeepMedix-R1 生成的推理(相较于广泛采用的 Qwen2.5-VL-7B 模型),专家们存在深远的偏好,确认了其在可解释性和临床实用性方面的优势。
引用
@article{arxiv.2509.03906,
title = {Toward Clinically Explainable AI for Medical Diagnosis: A Foundation Model with Human-Compatible Reasoning via Reinforcement Learning},
author = {Qika Lin and Yifan Zhu and Bin Pu and Ling Huang and Haoran Luo and Jingying Ma and Feng Wu and Kai He and Jiaxing Xu and Zhen Peng and Tianzhe Zhao and Fangzhi Xu and Jian Zhang and Zhonghong Ou and Erik Cambria and Swapnil Mishra and Mengling Feng},
journal= {arXiv preprint arXiv:2509.03906},
year = {2026}
}
备注
35 pages