中文

Med-R1:基于强化学习的通用医学推理视觉语言模型

计算机视觉与模式识别 2025-10-28 v5

摘要

视觉语言模型( VLM) 在自然图像推理方面取得了显著进展,但在医学影像领域的潜力仍未得到充分探索。医学视觉任务需要精准理解并给出临床连贯的答案,这由于医学数据的复杂性和高质量专家标注稀缺,使得传统的监督微调(SFT)和链式思维(CoT)策略难以实现。为此,我们提出 Med-R1,一个基于强化学习(RL)的视觉语言模型,旨在提高医学推理的泛化性和可靠性。基于 DeepSeek 策略,Med-R1 采用群相对策略优化(GRPO)以引导学习,超越静态标注。我们在八种不同的医学影像模态上全面评估了 Med-R1。相较于基础模型 Qwen2-VL-2B,Med-R1 在平均准确率上提升了 29.94%,甚至超过参数量高出 36 倍的 Qwen2-VL-72B 模型。为评估跨任务泛化,我们进一步在五种问题类型上测试了 Med-R1。Med-R1 在问题类型泛化方面相较于 Qwen2-VL-2B 提升了 32.06%,同样超越了 Qwen2-VL-72B。我们进一步探讨了 Med-R1 中的思考过程,这是 Deepseek-R1 成功的关键因素。我们的结果表明,若不考虑中间推理步骤(No-Thinking-Med-R1)不仅在原位和跨域泛化方面表现更佳,且训练所需时间更少,还挑战了“更多推理总是更好”的假设。这表明在医学 VQA 中,关键在于推理的质量和领域对齐,而非推理本身。综上所述,这些结果凸显了 RL 在提升医学推理和泛化方面的作用,为实际应用中的高效可靠 VLMs 铺平了道路。

关键词

引用

@article{arxiv.2503.13939,
  title  = {Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models},
  author = {Yuxiang Lai and Jike Zhong and Ming Li and Shitian Zhao and Yuheng Li and Konstantinos Psounis and Xiaofeng Yang},
  journal= {arXiv preprint arXiv:2503.13939},
  year   = {2025}
}