中文

Infi-MMR:通过多模态小语言模型中的分阶段强化学习基于课程解锁多模态推理

人工智能 2025-06-24 v3 计算与语言

摘要

大型语言模型 (LLM) 的最新进展展示了推理能力的实质性进步,例如 DeepSeek-R1,它利用基于规则的强化学习显著增强了逻辑推理。然而,将这些成就扩展到多模态大型语言模型 (MLLM) 带来了关键挑战,这对于多模态小语言模型 (MSLM) 而言通常更为明显,因为其基础推理能力通常较弱:(1) 高质量多模态推理数据集的稀缺,(2) 由于视觉处理的集成导致推理能力的退化,以及 (3) 直接应用强化学习可能产生复杂但不正确的推理过程的风险。为了应对这些挑战,我们设计了一个新颖的框架 Infi-MMR,通过精心构建的三个阶段的课程系统地解锁 MSLM 的推理潜力,并提出了我们的多模态推理模型 Infi-MMR-3B。第一阶段,基础推理激活,利用高质量文本推理数据集来激活和增强模型的逻辑推理能力。第二阶段,跨模态推理适应,利用图像描述增强的多模态数据来促进推理技能向多模态上下文的渐进迁移。第三阶段,多模态推理增强,采用精选的无图像描述多模态数据来减轻语言偏差并促进稳健的跨模态推理。Infi-MMR-3B 实现了最先进的多模态数学推理能力(在 MathVerse testmini 上为 43.68%,在 MathVision 测试上为 27.04%,在 OlympiadBench 上为 21.33%)和通用推理能力(在 MathVista testmini 上为 67.2%)。资源可在 https://huggingface.co/Reallm-Labs/Infi-MMR-3B 获取。

关键词

引用

@article{arxiv.2505.23091,
  title  = {Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models},
  author = {Zeyu Liu and Yuhang Liu and Guanghao Zhu and Congkai Xie and Zhen Li and Jianbo Yuan and Xinyao Wang and Qing Li and Shing-Chi Cheung and Shengyu Zhang and Fei Wu and Hongxia Yang},
  journal= {arXiv preprint arXiv:2505.23091},
  year   = {2025}
}