MedReason-R1:基于强化学习和局部放大的 CT 诊断推理学习
计算机视觉与模式识别
2025-10-23 v1
摘要
通用型大型视觉语言模型(VLM)在生成自然图像的详细描述方面表现出强大能力,但在医学领域的表现仍不理想,即使对于相对简单的任务也是如此,主要源于缺乏大规模、高质量的专业医学影像数据集,以及忽视诊断过程从粗到细的推进。为解决第一个问题,我们构建了 CT-RATE-VQA 数据集,包含 84K 对 QA 配对。为解决第二个问题,我们提出了 MedReason-R1,一个具备疾病诊断显式推理过程的医学 VLM。MedReason-R1 采用一种新颖策略,将疾病感兴趣区域嵌入图像中,凸显全球定位和疾病特定细节在提高模型诊断性能中的关键作用。此外,我们引入 GRPO 强化学习框架至 MedReason-R1,使其能够在不依赖昂贵手动标注的情况下实现有效推理。与最近的通用型和医学 VLM 相比,MedReason-R1 在 CT 疾病诊断中实现了最先进的性能,同时保持了泛化能力。代码、模型权重和数据集均可在 https://github.com/Leevan001/MedReason-R1 获取。
引用
@article{arxiv.2510.19626,
title = {MedReason-R1: Learning to Reason for CT Diagnosis with Reinforcement Learning and Local Zoom},
author = {Yifan Li and Fenghe Tang and Yingtai Li and Shaohua Kevin Zhou},
journal= {arXiv preprint arXiv:2510.19626},
year = {2025}
}
备注
The code, checkpoints, and dataset are available at: https://github.com/Leevan001/MedReason-R1