中文

SophiaVL-R1:通过思考奖励强化 MLLMs 的推理能力

计算机视觉与模式识别 2026-03-18 v2

摘要

近期的技术进步表明,通过基于规则的强化学习 (RL) 且以结果奖励为导向,成功引导了多模态大型语言模型 (MLLMs) 具备强大的推理能力。然而,这种范式通常缺乏对导致最终结果的思考过程的监督,导致模型可能学习亚最优的推理策略,从而阻碍其泛化能力。鉴于此,我们提出 SophiaVL-R1,旨在为该范式中的思考过程添加奖励信号。为实现此目标,我们首先训练一个评估整个思考过程质量的思考奖励模型。鉴于由于奖励作弊,某些样本的思考奖励可能不可靠,我们提出 Trust-GRPO 方法,在训练时为思考奖励分配可信度权重。该权重基于导致正确答案 versus 错误答案的响应之间的思考奖励比较计算得出,以帮助减轻可能不可靠思考奖励的影响。此外,我们设计了 annealing 训练策略,逐渐降低思考奖励,使模型在后期训练阶段能够更依赖准确的基于规则的结果奖励。实验表明,我们的 SophiaVL-R1 在多个基准测试(如 MathVisita、MIMU)上超越了系列推理 MLLMs,展现出强大的推理与泛化能力。值得注意的是,尽管后者参数量是前者的 10 倍,SophiaVL-R1-7B 仍在大多数基准测试中超越 LLaVA-OneVision-72B。所有代码、模型和数据集均已公开于 https://github.com/kxfan2002/SophiaVL-R1

关键词

引用

@article{arxiv.2505.17018,
  title  = {SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward},
  author = {Kaixuan Fan and Kaituo Feng and Haoming Lyu and Dongzhan Zhou and Xiangyu Yue},
  journal= {arXiv preprint arXiv:2505.17018},
  year   = {2026}
}

备注

ICLR 2026, Project page:https://github.com/kxfan2002/SophiaVL-R1