中文

VideoZeroBench:通过时空证据验证探测视频多模态大语言模型的极限

计算机视觉与模式识别 2026-04-03 v1 多媒体

摘要

近期的视频多模态大语言模型在各类基准测试中取得了令人印象深刻的结果。然而,当前评估存在两个关键局限:(1)虚高的分数可能掩盖细粒度视觉理解与推理的缺陷,(2)答案正确性通常在不验证模型是否识别支持其预测的精确时空证据的情况下进行衡量。为解决这一问题,我们提出了 VideoZeroBench,一个用于挑战性长视频问答的分层基准测试,严格验证时空证据。它包含 500 个手动标注的问题,覆盖 13 个领域,并配有时间区间和空间边界框作为证据。为了分离回答生成、时间定位和空间定位,我们引入了一个五级评估协议,逐步收紧证据要求。实验表明,即使 Gemini-3-Pro 在标准端到端问答设置(Level-3)下正确回答的问题也不到 17%。当施加定位约束时,性能急剧下降:在同时要求正确回答和精确时空定位时(Level-5),没有模型超过 1% 的准确率,大多数模型未能实现任何正确的定位预测。这些结果暴露了表面级答案正确性与真正的基于证据的推理之间的显著差距,揭示基于证据的视频理解仍是长视频问答的瓶颈。我们进一步在最小证据跨度、原子能力和推理范式方面分析了性能,为未来基于证据的视频推理研究提供了见解。基准测试和代码将公开发布。

关键词

引用

@article{arxiv.2604.01569,
  title  = {VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification},
  author = {Jiahao Meng and Tan Yue and Qi Xu and Haochen Wang and Zhongwei Ren and Weisong Liu and Yuhao Wang and Renrui Zhang and Yunhai Tong and Haodong Duan},
  journal= {arXiv preprint arXiv:2604.01569},
  year   = {2026}
}