中文

面向医学 VQA 的有效强化学习微调:基于视觉语言模型

计算与语言 2025-05-21 v1 人工智能 计算机视觉与模式识别

摘要

最近,强化学习 (RL) 基于调优的技术势力已改变多模态大语言模型 (MLLM) 的发展轨迹,特别是随着 Group Relative Policy Optimization (GRPO) 的引入。然而,直接将其应用于医学任务在实现临床导向模型行为方面仍具有挑战性。针对需要使模型响应与临床期望相吻合的需求,我们调查了四个关键维度,这些维度影响医学视觉问答 (VQA) 中 RL 基于调优的有效性:基础模型初始化策略、医学语义对齐的作用、基于长度奖励对长链推理的影响,以及偏见的影响。我们进行了大量实验以分析这些因素对医学 MLLM 的影响,为如何进行领域特定的微调提供了新见解。此外,我们的结果也表明,GRPO 基于 RL 调优在准确率和推理质量方面 consistently 优于标准监督微调 (SFT)。

关键词

引用

@article{arxiv.2505.13973,
  title  = {Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models},
  author = {Wenhui Zhu and Xuanzhao Dong and Xin Li and Peijie Qiu and Xiwen Chen and Abolfazl Razi and Aris Sotiras and Yi Su and Yalin Wang},
  journal= {arXiv preprint arXiv:2505.13973},
  year   = {2025}
}