中文

OpenMMReasoner:推动多模态推理的前沿发展,基于开放且通用的通用配方

人工智能 2025-12-08 v4 计算与语言

摘要

近期大型推理模型的快速发展,推动了将此类能力扩展至多模态领域的研究热情。然而,尽管在视觉推理方面取得了显著进展,但透明且可复现的数据 curated 与训练策略的缺失,仍是大规模研究的主要障碍。本文介绍了 OpenMMReasoner,这是一种完全透明的两阶段配方,用于多模态推理,涵盖监督微调(SFT)和强化学习(RL)。在 SFT 阶段,我们构建了一个包含 874K 样本的 cold-start 数据集,并进行严格的逐步验证,为推理能力提供了坚实的基础。随后,RL 阶段利用覆盖多样领域的 74K 样本数据集,进一步磨练和稳定这些能力, resulting in 更加稳健和高效的学习过程。广泛的评估表明,我们的训练配方不仅超越了强大的基线模型,还突显了数据质量和训练设计在塑造多模态推理性能中的关键作用。值得注意的是,我们的方法在九个多模态推理基准测试中相对于 Qwen2.5-VL-7B-Instruct baseline 取得了 11.6% 的提升,为未来的大规模多模态推理研究奠定了坚实的实证基础。我们已在 https://github.com/EvolvingLMMs-Lab/OpenMMReasoner 上开源所有代码、管道和数据。

关键词

引用

@article{arxiv.2511.16334,
  title  = {OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe},
  author = {Kaichen Zhang and Keming Wu and Zuhao Yang and Bo Li and Kairui Hu and Bin Wang and Ziwei Liu and Xingxuan Li and Lidong Bing},
  journal= {arXiv preprint arXiv:2511.16334},
  year   = {2025}
}