强化学习何时有助于医学视觉语言模型?解构视觉、SFT与RL效应
计算机视觉与模式识别
2026-03-03 v1
摘要
强化学习(RL)日益用于医学视觉语言模型(VLM)的后训练,但仍不清楚RL是否改善了医学视觉推理,或主要锐化了受监督微调(SFT)已诱导的行为。我们提出了受控研究,通过三个维度解构这些效应:视觉、SFT和RL。使用MedMNIST作为多模态测试平台,我们通过对比VLM视觉塔与视觉基线模型来探测视觉感知,通过Accuracy@1与Pass@K衡量推理支持和抽样效率,并评估RL何时闭合支持差距以及收益如何在不同模态间传递。我们发现,RL在模型已具备非平凡支持(高Pass@K)时最有效:它主要锐化输出分布,提高Acc@1和抽样效率,而SFT扩充支持并使RL生效。基于这些发现,我们提出一种边界感知配方,并通过在小型平衡PMC多选式VQA子集上后训练OctoMed初始化模型,实现了在六个医学VQA基准测试中的优异平均性能。
引用
@article{arxiv.2603.01301,
title = {When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains},
author = {Ahmadreza Jeddi and Kimia Shaban and Negin Baghbanzadeh and Natasha Sharan and Abhishek Moturu and Elham Dolatabadi and Babak Taati},
journal= {arXiv preprint arXiv:2603.01301},
year = {2026}
}