中文

视频理解奖励建模:一个鲁棒的基准与高性能奖励模型

计算机视觉与模式识别 2026-05-11 v1 人工智能

摘要

多模态奖励模型在文本和图像领域已取得显著进展,然而,由于缺乏鲁棒的评估基准和高质量的偏好数据,视频理解奖励建模的进展仍然严重受限。为解决此问题,我们提出了一个涵盖基准设计、数据构建和奖励模型训练的统一框架。我们引入了视频理解奖励基准(VURB),该基准包含 2100 个偏好对,具有长思维链推理轨迹(平均 1143 个 token),并在通用、长视频和推理导向的视频任务上采用多数投票评估。我们进一步通过全自动流程构建了视频理解偏好数据集(VUP-35K),为视频奖励训练提供大规模高质量监督。基于这些数据,我们训练了 VideoDRM(一个判别式奖励模型)和 VideoGRM(一个生成式奖励模型),两者均在 VURB 和 VideoRewardBench 上达到了最先进的性能。进一步分析证实,VUP-35K 提升了奖励性能和模型推理能力,而 VideoDRM 和 VideoGRM 在 NN 选最优测试时扩展下带来了显著增益。

关键词

引用

@article{arxiv.2605.07872,
  title  = {Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models},
  author = {Yuancheng Wei and Linli Yao and Lei Li and Haojie Zhang and Hao Zhou and Fandong Meng and Xu Sun},
  journal= {arXiv preprint arXiv:2605.07872},
  year   = {2026}
}