中文

PathVLM-R1:基于强化学习驱动的病理视觉语言任务推理模型

计算机视觉与模式识别 2025-04-21 v2 多媒体

摘要

病理图像诊断常受限于专家资源和地区差异,凸显了使用视觉语言模型(VLM)进行自动诊断的重要性。传统多模态模型通常侧重结果而非推理过程,导致临床决策可靠性受损。为解决病理VLMs推理能力弱且缺乏监督过程的问题,我们创新性地提出了PathVLM-R1,这是一种专为病理图像设计的视觉语言模型。我们基于Qwen2.5-VL-7B-Instruct,并通过精心设计的后训练策略提升了该模型在病理任务上的性能。首先,我们采用病理数据进行监督式微调,使模型具备基础病理知识,形成新的病理基础模型。随后,我们引入Group Relative Policy Optimization (GRPO)并提出基于双奖励的强化学习优化,确保推理过程的逻辑监督严格约束,并通过跨模态过程奖励和结果准确率奖励确保结果准确性。在病理图像问答任务中,PathVLM-R1的测试结果显示,其准确率比基线方法提高了14%,尽管参数规模显著小于Qwen2.5-VL-32B,仍展现出优异的性能。此外,在涵盖Computed Tomography (CT)、皮肤色素图、眼底摄影和光学相干断层扫描(OCT)图像等四种医学影像模态的跨域数据评估中,PathVLM-R1的迁移性能比传统SFT方法提高了平均17.3%。这些结果明确表明,PathVLM-R1不仅提升了准确率,也具备广泛的适用性和扩展潜力。

关键词

引用

@article{arxiv.2504.09258,
  title  = {PathVLM-R1: A Reinforcement Learning-Driven Reasoning Model for Pathology Visual-Language Tasks},
  author = {Jianyu Wu and Hao Yang and Xinhua Zeng and Guibing He and Zhiyu Chen and Zihui Li and Xiaochuan Zhang and Yangyang Ma and Run Fang and Yang Liu},
  journal= {arXiv preprint arXiv:2504.09258},
  year   = {2025}
}