中文

Vision-R1:激发多模态大语言模型的推理能力

计算机视觉与模式识别 2026-03-03 v4 人工智能 计算与语言 机器学习

摘要

DeepSeek-R1-Zero 成功地展示了纯粹通过强化学习 (RL) 在 LLM 中涌现出推理能力。受此突破的启发,我们探索了如何利用 RL 来增强 MLLM 的推理能力。然而,由于缺乏大量高质量的多模态推理数据,直接使用 RL 训练难以在 MLLM 中激活诸如质疑和反思等复杂的推理能力。为了解决这个问题,我们提出了推理 MLLM,即 Vision-R1,以提升多模态推理能力。具体而言,我们首先利用现有的 MLLM 和 DeepSeek-R1,通过模态桥接和数据过滤,构建了一个无需人工标注的高质量多模态 CoT 数据集,从而获得了 200K 的多模态 CoT 数据集,即 Vision-R1-cold 数据集。它作为 Vision-R1 的冷启动初始化数据。为了缓解冷启动后由过度思考引起的优化挑战,我们提出了渐进式思考抑制训练 (PTST) 策略,并采用了带有硬格式结果奖励函数的群体相对策略优化 (GRPO),以在 10K 多模态数学数据集上逐步细化模型学习正确且复杂推理过程的能力。综合实验表明,我们的模型在各种多模态数学推理基准上平均提升了约 6%。Vision-R1-7B 在广泛使用的 MathVista 基准上达到了 73.5% 的准确率,仅比领先的推理模型 OpenAI O1 低 0.4%。通过扩大 RL 训练中多模态数学数据的数量,Vision-R1-32B 和 Vison-R1-72B 分别取得了 76.4% 和 78.2% 的 MathVista 基准分数。数据集和代码将发布于:https://github.com/Osilly/Vision-R1 。

关键词

引用

@article{arxiv.2503.06749,
  title  = {Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models},
  author = {Wenxuan Huang and Bohan Jia and Zijie Zhai and Shaosheng Cao and Zheyu Ye and Fei Zhao and Zhe Xu and Xu Tang and Yao Hu and Shaohui Lin},
  journal= {arXiv preprint arXiv:2503.06749},
  year   = {2026}
}

备注

Accepted to ICLR 2026. Code is available at https://github.com/Osilly/Vision-R1