VideoRewardBench:面向视频理解的多模态奖励模型全面评估基准
计算机视觉与模式识别
2025-09-03 v1 人工智能
摘要
多模态奖励模型(MRMs)在大型视觉语言模型(LVLMs)的训练、推理和评估中发挥着关键作用,通过评估响应质量来衡量。然而,现有针对视频领域的MRM评估基准存在问题包括:问题数量和多样性有限、缺乏全面的评估维度,以及对不同类型的MRM进行不充分的评估。为此,我们引入VideoRewardBench,这是第一个覆盖视频理解四个核心方面的全面基准:感知、知识、推理和安全。通过我们构建的AI辅助数据管道,我们策划了包含1,563个标注样本的高质量偏好数据集,其中包括1,482个独特视频和1,559个独特问题——这是目前最丰富的先前基准中问题数量的15倍。每个样本都是一个三元组,包含视频文本提示、被选取的响应和被拒绝的响应。我们还对28个跨模态奖励模型进行了全面评估,涵盖三个类别:生成式、判别式和半标量。结果显示,即使是表现最好的模型GPT-4o也仅达到57.0%的整体准确率,最佳开源模型Qwen2.5-VL-72B仅达到53.3%。我们的分析进一步揭示了三个关键见解:(i) 使用强化学习训练的MRMs不一定比未使用强化学习训练的MRMs在跨模态泛化方面更强;(ii) 除了判别式MRMs外,其他类型的MRMs在不同模型容量下都可以从推理时扩展中受益;(iii) 输入视频帧数的变化对不同类型的MRMs具有不同的影响。我们相信VideoRewardBench为推动视频领域MRMs的评估和发展提供了一个具有挑战性和价值的基准。
引用
@article{arxiv.2509.00484,
title = {VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding},
author = {Zhihong Zhang and Xiaojian Huang and Jin Xu and Zhuodong Luo and Xinzhi Wang and Jiansheng Wei and Xuejin Chen},
journal= {arXiv preprint arXiv:2509.00484},
year = {2025}
}
备注
https://videorewardbench.github.io/