面向视觉语言慢思考推理的半离-policy 强化学习
机器学习
2025-10-23 v2 计算机视觉与模式识别
摘要
增强大型视觉语言模型 (LVLMs) 的视觉慢思考推理能力是解决复杂多模态任务的关键挑战。然而,由于LVLMs主要进行视觉语言对齐训练,采用基于策略的强化学习 (RL) 来发展慢思考能力困难,因为滚动空间受限于其初始能力。离-policy RL提供了超越当前策略的途径,但直接从外部模型提取轨迹可能导致视觉幻觉,因为模型之间视觉感知能力不匹配。为解决这些问题,本文提出SOPHIA:一种简单且可扩展的面向视觉语言慢思考推理的半离-policy RL。SOPHIA通过将来自可训练LVLM的基于策略的视觉理解与来自语言模型的离-policy慢思考推理相结合,构建半离-policy行为模型,分配基于结果的奖励给推理过程,并反向传播视觉奖励。随后,LVLMs通过离-policy RL算法中的传播奖励,从获取的推理轨迹中学习慢思考推理能力。在InternVL2.5和InternVL3.0(分别为8B和38B参数规模)的广泛实验中显示SOPHIA的有效性。值得注意的是,SOPHIA使InternVL3.0-38B在多个多模态推理基准测试中实现平均提升8.50%,达到开源LVLMs的最新性能,甚至在挑战性的MathVision和OlympiadBench上超越了一些闭源模型(如GPT-4.1),分别实现49.08%和49.95%的通过率@1准确率。分析表明,SOPHIA在监督微调和直接基于策略的RL方法方面表现更优,为进一步的基于策略训练提供更好的策略初始化。
关键词
引用
@article{arxiv.2507.16814,
title = {Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning},
author = {Junhao Shen and Haiteng Zhao and Yuzhe Gu and Songyang Gao and Kuikun Liu and Haian Huang and Jianfei Gao and Dahua Lin and Wenwei Zhang and Kai Chen},
journal= {arXiv preprint arXiv:2507.16814},
year = {2025}
}