中文

MM-Eureka:基于规则强化学习的多模态推理前沿探索

计算机视觉与模式识别 2025-04-16 v2

摘要

DeepSeek R1 和 o1 通过稳定的大规模强化学习在文本领域展示了强大的推理能力。为了实现更广泛的应用,一些工作试图将这些能力迁移到多模态推理中。然而,这些努力受限于所选任务的难度有限以及相对较小的训练规模,难以展现出强大的多模态推理能力。为了弥补这一差距,我们引入了 MMK12 数据集以及具有 7B 和 32B 参数的 MM-EUREKA。前者是一个高质量的多模态数学推理数据集,涵盖多样化的知识领域,并包含人工验证的答案与求解过程。后者是在 MMK12 上采用基于规则的强化学习的多模态模型,利用在线过滤和两阶段训练策略来增强训练稳定性。MM-EUREKA 在多模态数学推理中展现出显著的性能提升,超越了以往强大的模型如 InternVL2.5-78B 或 InternVL2.5-38B-MPO。特别地,与开源和闭源模型相比,MM-EUREKA 取得了具有竞争力或更优的性能,在多学科推理任务中仅略逊于 o1。我们开源了完整的流程以促进该领域的进一步研究。我们在 https://github.com/ModalMinds/MM-EUREKA 发布了所有的代码、模型、数据等。

关键词

引用

@article{arxiv.2503.07365,
  title  = {MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning},
  author = {Fanqing Meng and Lingxiao Du and Zongkai Liu and Zhixiang Zhou and Quanfeng Lu and Daocheng Fu and Tiancheng Han and Botian Shi and Wenhai Wang and Junjun He and Kaipeng Zhang and Ping Luo and Yu Qiao and Qiaosheng Zhang and Wenqi Shao},
  journal= {arXiv preprint arXiv:2503.07365},
  year   = {2025}
}