Video-MME-v2:迈向全面视频理解基准的下一阶段
计算机视觉与模式识别
2026-04-08 v1
摘要
随着视频理解的快速发展,现有基准测试正变得日益饱和,暴露了虚高的排行榜分数与真实世界模型能力之间的关键差距。为应对这一日益扩大的差距,我们提出了Video-MME-v2,一个旨在严格评估视频理解鲁棒性和忠实性的综合基准。为系统评估模型能力,我们设计了一个渐进的三级层次结构,逐步增加视频理解的复杂度,从多点视觉信息聚合,到时间动力学建模,最终到复杂的多模态推理。此外,与传统的逐问题准确率不同,我们提出了一种基于组的非线性评估策略,强制要求相关查询之间的一致性和多步推理的连贯性。它惩罚碎片化或猜测式的正确性,仅对由有效推理支持的答案给予认可。为保证数据质量,Video-MME-v2通过严格可控的人工标注流程构建,涉及12名标注员和50名独立评审员。在3,300人工小时和多达5轮质量保证的支持下,Video-MME-v2旨在成为最权威的视频基准之一。大量实验揭示了当前最佳模型Gemini-3-Pro与人类专家之间的显著差距,并揭示了一个清晰的层次瓶颈:视觉信息聚合和时间建模中的错误会传播并限制高层推理。我们进一步发现,基于思考的推理高度依赖文本线索,字幕能提升性能,但在纯视觉场景中有时会降低性能。通过揭示这些局限性,Video-MME-v2为下一代视频MLLM的开发建立了要求严苛的新测试平台。
引用
@article{arxiv.2604.05015,
title = {Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding},
author = {Chaoyou Fu and Haozhi Yuan and Yuhao Dong and Yi-Fan Zhang and Yunhang Shen and Xiaoxing Hu and Xueying Li and Jinsen Su and Chengwu Long and Xiaoyao Xie and Yongkang Xie and Xiawu Zheng and Xue Yang and Haoyu Cao and Yunsheng Wu and Ziwei Liu and Xing Sun and Caifeng Shan and Ran He},
journal= {arXiv preprint arXiv:2604.05015},
year = {2026}
}
备注
Homepage: https://video-mme-v2.netlify.app/