中文

面向多模态推理测试时扩缩的视觉语言过程奖励模型:关键见解与经验教训

人工智能 2025-10-08 v3 计算机视觉与模式识别

摘要

过程奖励模型(PRMs)提供逐步级别的监督,提高大型语言模型推理的可靠性。虽然PRMs在文本领域得到了广泛研究,但其在视觉语言模型(VLM)上的扩展仍有限。现有的视觉语言PRMs(VL-PRMs)依赖蒙特卡洛树搜索(MCTS)构建数据,常产生噪声较大的监督信号并限制跨任务泛化。本文旨在阐明VL-PRMs的设计空间,通过探索数据构建、训练和测试时扩缩的多种策略。首先,我们引入混合数据合成框架,将MCTS与强VLM判断相结合,生成更准确的逐步标签。其次,我们提出感知聚焦监督,使PRM能够显式检测视觉 grounding 阶段的错误。我们系统评估了多种测试时扩缩策略,表明我们的PRMs可可靠地引导VLM朝向更准确的解决方案。实验覆盖五个多模态基准(MMMU、PuzzleVQA、AlgoPuzzleVQA、MathVista和MathVision),揭示若干关键见解:(i)在测试时扩缩中用作结果奖励模型(ORM)的VL-PRMs可优于VL-PRM引导的步骤选择;(ii)较小的VL-PRMs可匹配甚至超越较大的模型在检测过程错误方面;(iii)VL-PRMs发现更强VLM后端潜在推理能力;(iv)感知级别监督在测试时扩缩中取得显著提升;(v)不同策略的测试时扩缩性能在高级数学推理数据集上提升,尽管未在此类数据集上训练VL-PRMs。我们希望本工作能激发进一步的研究并推动VLM的发展。

关键词

引用

@article{arxiv.2509.23250,
  title  = {Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned},
  author = {Brandon Ong and Tej Deep Pala and Vernon Toh and William Chandra Tjhi and Soujanya Poria},
  journal= {arXiv preprint arXiv:2509.23250},
  year   = {2025}
}