中文

通过过程奖励模型解锁多模态数学推理能力

计算与语言 2025-10-07 v6 人工智能 机器学习

摘要

过程奖励模型 (PRMs) 在通过测试时间扩展 (TTS) 提升大语言模型 (LLMs) 的数学推理能力方面显示出前景。然而,它们在多模态推理中的集成仍属未开发领域。本文我们迈出了第一个步骤,探索 PRMs 在多模态数学推理中的潜力。我们识别出三个关键挑战:(1) 高质量推理数据的稀缺限制了基础多模态大语言模型 (MLLMs) 的能力,从而进一步限制了 TTS 和强化学习 (RL) 的上限;(2) 缺乏针对多模态情境的 process labeling 自动方法;(3) 在单模态 RL 中应用过程奖励面临奖励作弊等问题,这些问题可能延伸至多模态场景。为解决这些问题,我们引入了 URSA,即三阶段 Unfolding 多模态 Process-Supervision Aided training 框架。我们首先构建 MMathCoT-1M,一个大规模多模态链式思维 (CoT) 推理数据集,以构建更强大的数学推理基础 MLLM,URSA-8B。随后,我们通过自动化 process 合成 process supervision data,强调逻辑正确性和感知一致性。我们引入 DualMath-1.1M 以促进 URSA-8B-RM 的训练。最后,我们提出 Process-Supervised Group-Relative-Policy-Optimization (PS-GRPO),首次实现多模态 PRM 辅助的在线 RL 方法,优于 vanilla GRPO。应用 PS-GRPO后,URSA-8B-PS-GRPO 在 6 个基准测试中平均优于 Gemma3-12B 和 GPT-4o,分别提升 8.4% 和 2.7%。代码、数据和 checkpoint 可在 https://github.com/URSA-MATH 查阅。

关键词

引用

@article{arxiv.2501.04686,
  title  = {Unlocking Multimodal Mathematical Reasoning via Process Reward Model},
  author = {Ruilin Luo and Zhuofan Zheng and Yifan Wang and Xinzhe Ni and Zicheng Lin and Songtao Jiang and Yiyao Yu and Chufan Shi and Lei Wang and Ruihang Chu and Jin Zeng and Yujiu Yang},
  journal= {arXiv preprint arXiv:2501.04686},
  year   = {2025}
}

备注

NeurIPS 2025 Main Track