ViLBench:面向视觉-语言过程奖励建模的基准套件
计算机视觉与模式识别
2025-03-27 v1 计算与语言
摘要
以过程监督的奖励模型作为为模型响应提供细粒度、逐步反馈的函数,能够促进复杂任务中对推理轨迹的有效选择。尽管存在上述优势,但关于过程奖励模型(PRM)的评估仍属未被充分探索的领域,尤其在多模态领域。为填补这一空白,本文首先在多个视觉-语言基准上对当前视觉大语言模型(VLLM)进行评估,将其作为两种类型的奖励模型:输出奖励模型(ORM)和过程奖励模型(PRM),结果显示,无论是ORM还是PRM都无法在所有任务中一致 outperform,且优秀的VLLM也不一定能获得更好的奖励性能。为进一步推进评估,我们引入ViLBench——一个需要密集过程奖励信号的视觉-语言基准。值得注意的是,尽管OpenAI的GPT-4o配合链式思考(CoT)仅 achieves 27.3%的准确率,这表明该基准对当前VLLM具有较大挑战性。最后,我们初步展示了一条连接通用VLLM与奖励模型之间的可行路径——通过使用增强型树搜索算法收集73.6K条视觉-语言过程奖励数据,我们的3B模型在ViLBench上相对于标准CoT平均提升3.3%,相对于未训练的模型提升最高达2.5%,并选取OpenAI o1的生成结果。我们将在https://ucsc-vlaa.github.io/ViLBench 公开实现,包括代码、模型和数据。
引用
@article{arxiv.2503.20271,
title = {ViLBench: A Suite for Vision-Language Process Reward Modeling},
author = {Haoqin Tu and Weitao Feng and Hardy Chen and Hui Liu and Xianfeng Tang and Cihang Xie},
journal= {arXiv preprint arXiv:2503.20271},
year = {2025}
}