中文

LMM-R1:通过两阶段基于规则的强化学习赋予 3B LMMs 强大推理能力

计算与语言 2025-03-12 v2 人工智能

摘要

增强大型多模态模型(LMMs)的推理能力面临着视觉感知与逻辑推理之间复杂相互作用的独特挑战,尤其是在架构限制推理能力和模态对齐的紧凑 3B 参数架构中。尽管基于规则的强化学习(RL)在纯文本领域表现出色,但其多模态扩展面临两个关键障碍:(1)由于答案模糊和复杂推理示例稀缺导致的数据限制,以及(2)多模态预训练引起的基础推理能力退化。为了应对这些挑战,我们提出了 LMM-R1,这是一个两阶段框架,通过基础推理增强(FRE)和随后的多模态泛化训练(MGT),将基于规则的 RL 适应于多模态推理。FRE 阶段首先使用纯文本数据和基于规则的 RL 增强推理能力,然后 MGT 阶段将这些推理能力泛化到多模态领域。在 Qwen2.5-VL-Instruct-3B 上的实验表明,LMM-R1 在多模态和纯文本基准上分别取得了 4.83% 和 4.5% 的平均提升,在复杂足球比赛任务中取得了 3.63% 的提升。这些结果验证了基于文本的推理增强能够实现有效的多模态泛化,提供了一种绕过昂贵的高质量多模态训练数据的数据高效范式。

关键词

引用

@article{arxiv.2503.07536,
  title  = {LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL},
  author = {Yingzhe Peng and Gongrui Zhang and Miaosen Zhang and Zhiyuan You and Jie Liu and Qipeng Zhu and Kai Yang and Xingzhong Xu and Xin Geng and Xu Yang},
  journal= {arXiv preprint arXiv:2503.07536},
  year   = {2025}
}