中文

面向开放式医学推理的自适应强化学习:语义引导奖励消融缓解

计算机视觉与模式识别 2026-04-03 v3

摘要

基于规则化奖励函数的强化学习 (RL) 近期在增强视觉语言模型 (VLM) 的推理深度和泛化能力方面展现了巨大潜力,同时保持计算效率。尽管如此,该方法在医学成像领域的应用仍有限。当前该领域的强化微调 (RFT) 工作主要聚焦于封闭式视觉问答 (VQA),限制了其在现实临床推理中的适用性。然而,开放式医学 VQA 更贴近临床诊断流程,却鲜有探索。尽管已有研究试图通过语义引导的 RL 弥合两种格式,但模型驱动的语义奖励常常出现奖励消融,即不同语义的响应获得接近的分数。为克服此限制,我们引入 Adaptive Reinforcement for Medical Reasoning (ARMed),这是一种专为开放式医学 VQA 设计的新型 RL 框架。ARMed 首先通过在链式思考注释上进行监督微调 (SFT) 注入领域专业知识,随后使用文本正确性和自适应语义奖励进行强化优化,以细化推理一致性和事实准确性。在六个具挑战性的医学 VQA 数据集上进行大规模实验表明,ARMed 在准确率和泛化能力方面均实现显著提升。这些发现凸显了医学 RL 中奖励可区分性的重要性,并彰显了自适应语义奖励在构建稳健、临床可靠的多模态推理系统方面的潜力。

关键词

引用

@article{arxiv.2508.12957,
  title  = {Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation},
  author = {Yizhou Liu and Dingkang Yang and Zizhi Chen and Minghao Han and Xukun Zhang and Keliang Liu and Jingwei Wei and Lihua Zhang},
  journal= {arXiv preprint arXiv:2508.12957},
  year   = {2026}
}

备注

Accept to 2026 CVPR Findings