VisualPRM: 一种有效的多模态推理过程奖励模型
计算机视觉与模式识别
2025-03-14 v1 计算与语言
摘要
我们提出了VisualPRM,一种先进的多模态过程奖励模型(PRM),拥有8B参数,通过Best-of-N(BoN)评估策略提升了现有多模态大语言模型(MLLM)在不同模型规模和家族中的推理能力。具体而言,我们的模型改进了三种类型MLLM和四种不同模型规模的推理性能。即使应用于能力极强的InternVL2.5-78B,在七个多模态推理基准上也实现了5.9点的提升。实验结果表明,与结果奖励模型和自一致性相比,我们的模型在BoN评估中表现出优越性能。为促进多模态PRM的训练,我们利用自动化数据流水线构建了多模态过程监督数据集VisualPRM400K。为评估多模态PRM,我们提出了VisualProcessBench,一个具有人工标注逐步正确性标签的基准,用于衡量PRM在多模态推理任务中检测错误步骤的能力。我们希望我们的工作能够启发更多未来研究,并为MLLM的发展做出贡献。我们的模型、数据和基准已发布在https://internvl.github.io/blog/2025-03-13-VisualPRM/。
引用
@article{arxiv.2503.10291,
title = {VisualPRM: An Effective Process Reward Model for Multimodal Reasoning},
author = {Weiyun Wang and Zhangwei Gao and Lianjie Chen and Zhe Chen and Jinguo Zhu and Xiangyu Zhao and Yangzhou Liu and Yue Cao and Shenglong Ye and Xizhou Zhu and Lewei Lu and Haodong Duan and Yu Qiao and Jifeng Dai and Wenhai Wang},
journal= {arXiv preprint arXiv:2503.10291},
year = {2025}
}