中文

推进多模态推理:从优化的冷启动到分阶段强化学习

机器学习 2026-01-29 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

受到 DeepSeek-R1 在复杂文本任务中卓越推理能力的启发,许多工作试图通过直接应用强化学习(RL)来激发多模态大语言模型(MLLM)中的类似能力。然而,它们在激活复杂推理方面仍然存在困难。在本文中,我们并非孤立地考察多模态 RL,而是深入分析当前的训练流水线,并识别出三个关键现象:1)有效的冷启动初始化对增强 MLLM 推理至关重要。有趣的是,我们发现仅使用精心筛选的文本数据进行初始化,就能在多模态 RL 之前使性能超越许多近期的多模态推理模型。2)应用于多模态 RL 的标准 GRPO 存在梯度停滞问题,降低了训练稳定性和性能。3)在多模态 RL 阶段之后进行的后续纯文本 RL 训练进一步增强了多模态推理。这种分阶段训练方法有效平衡了感知基础与认知推理的发展。通过融合上述洞察并解决多模态 RL 问题,我们提出了 ReVisual-R1,在 MathVerse、MathVision、WeMath、LogicVista、DynaMath 以及具有挑战性的 AIME2024 和 AIME2025 等基准测试中取得了开源 7B MLLM 的新最先进性能。

关键词

引用

@article{arxiv.2506.04207,
  title  = {Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning},
  author = {Shuang Chen and Yue Guo and Zhaochen Su and Yafu Li and Yulun Wu and Jiacheng Chen and Jiayu Chen and Weijie Wang and Xiaoye Qu and Yu Cheng},
  journal= {arXiv preprint arXiv:2506.04207},
  year   = {2026}
}

备注

19 pages, 6 figures