VRPRM:基于视觉推理的过程奖励建模
机器学习
2026-05-22 v3
摘要
过程奖励模型(PRM)因能够对生成内容的推理步骤进行细粒度评估而在大型语言模型(LLM)的后训练中广泛应用。然而,大多数PRM缺乏长期推理和深度思考能力。另一方面,尽管已有少数工作尝试将链式思考(CoT)能力引入PRM,但CoT-PRM数据的标注成本过高,难以在各种任务中发挥稳定作用。为此,我们提出VRPRM,即通过视觉推理的过程奖励模型,设计了高效的两阶段训练策略。实验结果表明,仅使用 3.6K 条CoT-PRM监督微调(SFT)数据和 50K 条非CoT PRM强化学习(RL)训练数据,VRPRM便可超过标注成本高达 40 万条的传统PRM,在BoN实验中相对于基础模型实现最高 118% 的性能提升。这一结果确认,所提出的组合训练策略可在更低的数据标注成本下实现更高质量的推理能力,为PRM训练的更高效数据利用提供了新范式。
引用
@article{arxiv.2508.03556,
title = {VRPRM: Process Reward Modeling via Visual Reasoning},
author = {Xinquan Chen and Chongying Yue and Bangwei Liu and Xuhong Wang and Yingchun Wang and Chaochao Lu},
journal= {arXiv preprint arXiv:2508.03556},
year = {2026}
}
备注
20 pages, 11 figures