VideoEval-Pro:稳健且真实的长视频理解评估
摘要
大型多模态模型(LMM)近期涌现为处理长视频理解(LVU)的强大工具,推动了标准化 LVU 基准测试的开发以评估其性能。然而,我们的调查揭示了既有 LVU 基准测试的尴尬教训:第一,大多数现有基准测试严重依赖多选题(MCQs),其评估结果因可能随机猜测正确答案而被高估;第二,这些基准测试中相当比例的题目具有强烈先验,可让模型在甚至未阅读输入视频的情况下直接作答。例如,Gemini-1.5-Pro 在 Video-MME 上仅给定长视频的一个随机帧即可实现超过 50% 的准确率。我们还观察到,增加帧数并不一定在现有基准测试上带来提升,这与直觉相悖。因此,当前 LVU 基准测试的有效性和鲁棒性受到削弱,妨碍了对 LMM 长视频理解能力的忠实评估。为解决此问题,我们提出 VideoEval-Pro,一种包含需真正理解整个视频才能作答的开放式短答题的真实 LVU 基准测试。VideoEval-Pro 通过感知和推理任务评估段落级和全视频理解。我们对 21 种专有和开源视频 LMM 进行评估,得出以下结论:(1) 视频 LMM 在开放式问题上表现比 MCQs 降低超过 25%;(2) surprisingly, 更高的 MCQ 分数并不必然导致 VideoEval-Pro 上更高的开放式得分;(3) 与其他 MCQ 基准测试相比,VideoEval-Pro 从增加输入帧数中受益更大。我们的结果表明,VideoEval-Pro 提供了更真实可靠的长视频理解衡量,为该领域的进展提供了更清晰的视角。
引用
@article{arxiv.2505.14640,
title = {VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation},
author = {Wentao Ma and Weiming Ren and Yiming Jia and Zhuofeng Li and Ping Nie and Ge Zhang and Wenhu Chen},
journal= {arXiv preprint arXiv:2505.14640},
year = {2025}
}
备注
Dataset: https://huggingface.co/datasets/TIGER-Lab/VideoEval-Pro, Project Webpage: https://tiger-ai-lab.github.io/VideoEval-Pro