中文

基于带冷启动的强化学习推进多模态推理

计算与语言 2025-07-24 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

大型语言模型(LLMs)的最新进展展示了令人印象深刻的思维链推理能力,其中强化学习(RL)在这一进展中发挥了关键作用。尽管“顿悟时刻”模式——即模型通过反思表现出自我纠正——通常被归因于 RL 涌现出的特性,但我们首先证明这些模式在 RL 训练之前就已存在于多模态 LLMs(MLLMs)中,但未必与推理性能的提升相关。基于这些洞察,我们提出了一项通过两阶段方法增强多模态推理的综合研究:(1)以结构化思维链推理模式作为冷启动的监督微调(SFT),随后(2)通过 GRPO 进行强化学习以进一步精炼这些能力。我们广泛的实验表明,在具有挑战性的多模态推理基准上,这种组合方法始终优于仅使用 SFT 和仅使用 RL 的方法。由此产生的模型在 3B 和 7B 规模的开源 MLLMs 中均实现了 SOTA 性能,其中我们的 7B 模型相比基础模型取得了显著提升(例如,在 MathVista 上 66.3 %\rightarrow73.4 %,在 We-Math 上 62.9 %\rightarrow70.4 %),而我们的 3B 模型实现了与多个 7B 模型相媲美的性能。总体而言,这项工作为构建高级多模态推理模型提供了实用指导。我们的代码可在 https://github.com/waltonfuture/RL-with-Cold-Start 获取。

关键词

引用

@article{arxiv.2505.22334,
  title  = {Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start},
  author = {Lai Wei and Yuting Li and Kaipeng Zheng and Chen Wang and Yue Wang and Linghe Kong and Lichao Sun and Weiran Huang},
  journal= {arXiv preprint arXiv:2505.22334},
  year   = {2025}
}