中文

MedVLM-R1:通过强化学习激励视觉语言模型的医学推理能力

计算机视觉与模式识别 2025-03-20 v2 人工智能

摘要

推理是推进医学图像分析的关键前沿领域,其中透明性和可信度在临床医生信任和监管审批中都扮演着核心角色。尽管医学视觉语言模型(VLM)在放射学任务中展现出前景,但大多数现有VLM仅产生最终答案而不揭示底层推理过程。为弥补这一空白,我们引入了MedVLM-R1,一种明确生成自然语言推理以增强透明性和可信度的医学VLM。与依赖监督微调(SFT)的方法不同——后者常因过拟合于训练分布且无法培养真正的推理能力——MedVLM-R1采用强化学习框架,激励模型在不使用任何推理参考的情况下发现人类可解释的推理路径。尽管训练数据有限(600个视觉问答样本)和模型参数较少(2B),MedVLM-R1在MRI、CT和X-ray基准测试上将准确率从55.11%提升至78.22%,优于在超过百万样本上训练的更大模型。它还在分布外任务中展现出稳健的领域泛化能力。通过将医学图像分析与显式推理相结合,MedVLM-R1标志着向临床实践中可信且可解释的AI迈出了关键一步。推理模型可在以下地址获取:https://huggingface.co/JZPeterPan/MedVLM-R1。

关键词

引用

@article{arxiv.2502.19634,
  title  = {MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning},
  author = {Jiazhen Pan and Che Liu and Junde Wu and Fenglin Liu and Jiayuan Zhu and Hongwei Bran Li and Chen Chen and Cheng Ouyang and Daniel Rueckert},
  journal= {arXiv preprint arXiv:2502.19634},
  year   = {2025}
}