中文

R1-ShareVL:通过 Share-GRPO 激励多模态大语言模型的推理能力

计算机视觉与模式识别 2025-05-23 v1 人工智能 计算与语言

摘要

在这项工作中,我们旨在通过强化学习(RL)激励多模态大语言模型(MLLM)的推理能力,并开发一种有效方法来缓解 RL 过程中的稀疏奖励和优势消失问题。为此,我们提出了 Share-GRPO,这是一种新颖的 RL 方法,通过在扩展的问题空间上探索和共享多样化的推理轨迹来解决这些问题。具体而言,Share-GRPO 首先通过数据变换技术为给定问题扩展问题空间,然后鼓励 MLLM 在扩展的问题空间上有效探索多样化的推理轨迹,并在 RL 过程中跨扩展问题共享发现的推理轨迹。此外,Share-GRPO 还在优势计算期间共享奖励信息,该计算跨问题变体分层估计解决方案优势,从而能够更准确地估计相对优势并提高策略训练的稳定性。在六个广泛使用的推理基准上的广泛评估展示了我们方法的优越性能。代码将可在 https://github.com/HJYao00/R1-ShareVL 获取。

关键词

引用

@article{arxiv.2505.16673,
  title  = {R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO},
  author = {Huanjin Yao and Qixiang Yin and Jingyi Zhang and Min Yang and Yibo Wang and Wenhao Wu and Fei Su and Li Shen and Minghui Qiu and Dacheng Tao and Jiaxing Huang},
  journal= {arXiv preprint arXiv:2505.16673},
  year   = {2025}
}

备注

Technical report