RARL:在数据与硬件约束下通过强化学习与LoRA提升医学视觉语言模型的推理与泛化能力
计算机视觉与模式识别
2025-06-17 v2
摘要
视觉语言模型(VLM)在医疗领域的快速集成为诊断推理提供了广阔的支持。然而,当前医学VLMs常面临泛化性、透明度和计算效率受限的问题——这些障碍阻碍了在资源受限的实际环境中部署。为此,我们提出了一种推理导向的强化学习框架,\textbf{RARL},以提升医学VLMs的推理能力,同时保持高效和适应低资源环境的能力。我们的方法使用低秩适应(LoRA)和自定义奖励函数对轻量级基础模型Qwen2-VL-2B-Instruct进行微调,奖励函数同时考虑诊断准确性和推理质量。在单块NVIDIA A100-PCIE-40GB GPU上完成训练,展示了在受限环境中部署此类模型的可行性。我们采用LLM-as-judge框架对模型进行评估,对正确性和解释质量进行评分。实验结果表明,RARL在医学图像分析和临床推理方面显著优于监督微调,在推理-focused任务中表现出约7.78%的提升,同时所需计算资源更少。此外,我们在不可见数据集上展示了该方法的泛化能力,相较于监督微调实现约27%的性能提升,相较于传统RL微调实现约4%的提升。我们的实验还表明,在训练期间使用多样性提示,在推理期间使用推理提示是提升VLM性能的关键。我们的发现凸显了推理引导学习和推理提示在引导医学VLMs实现更透明、准确且资源高效的临床决策方面的潜力。代码和数据已公开。
引用
@article{arxiv.2506.06600,
title = {RARL: Improving Medical VLM Reasoning and Generalization with Reinforcement Learning and LoRA under Data and Hardware Constraints},
author = {Tan-Hanh Pham and Chris Ngo},
journal= {arXiv preprint arXiv:2506.06600},
year = {2025}
}
备注
Under review