中文

什么、是否以及如何?面向图像思维推理的过程奖励模型揭秘

计算机视觉与模式识别 2026-02-10 v1

摘要

大型视觉语言模型(LVLMs)的快速发展在各种视觉任务中展现了卓越的能力。基于这些进展,图像思维推理范式应运而生,使模型能够在每个推理步骤动态编辑和重新编码视觉信息,模拟人类的视觉处理过程。然而,这种范式带来了重大挑战,因为在推理过程中可能发生各种错误。这就需要过程奖励模型(PRM)来区分正面和负面的推理步骤,然而现有的PRM基准主要以文本为中心,缺乏在这种范式下的全面评估。为了弥补这些空白,本工作引入了第一个专门用于在图像思维推理范式下评估PRM的全面基准。我们的主要贡献是:(1)通过对推理轨迹的广泛分析和使用PRM的引导搜索实验,我们定义了7种细粒度错误类型,并证明了专用PRM的必要性和改进潜力。(2)我们构建了一个全面的基准,包含1,206条手动标注的图像思维推理轨迹,涵盖4个类别和16个子类别,用于PRM的细粒度评估。(3)我们的实验分析表明,当前的LVLMs作为有效的PRM存在不足,在视觉推理过程评估中表现出有限的能力,在错误类型间存在显著的性能差异、正向评估偏差以及对推理步骤位置的敏感性。这些发现证明了我们基准的有效性,并为推进LVLMs中的PRM奠定了关键基础。

关键词

引用

@article{arxiv.2602.08346,
  title  = {What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning},
  author = {Yujin Zhou and Pengcheng Wen and Jiale Chen and Boqin Yin and Han Zhu and Jiaming Ji and Juntao Dai and Chi-Min Chan and Sirui Han},
  journal= {arXiv preprint arXiv:2602.08346},
  year   = {2026}
}