面向多视频理解评估的 MVU-Eval
计算机视觉与模式识别
2025-11-14 v2 人工智能
摘要
多模态大语言模型 (MLLM) 的兴起已扩展了 AI 在视觉模态上的能力,但现有评估基准仅限于单视频理解,忽略了现实场景中(如体育分析和自动驾驶)对多视频理解的关键需求。为此,我们引入 MVU-Eval,首个针对 MLLM 进行多视频理解综合评估基准。具体而言,MVU-Eval 通过 1,824 对精心策划的问答对,覆盖 4,959 个来自不同领域的视频,评估八项核心能力,涵盖基础感知任务与高阶推理任务。这些能力与实际应用场景(如自动驾驶系统中的多传感器融合和跨角度体育分析)严格对齐。通过对最先进的开源与闭源模型进行广泛评估,我们揭示了当前 MLLM 在跨多视频理解能力上的显著差距与局限性。该基准将对外公开,以促进未来研究的发展。
引用
@article{arxiv.2511.07250,
title = {MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs},
author = {Tianhao Peng and Haochen Wang and Yuanxing Zhang and Zekun Wang and Zili Wang and Gavin Chang and Jian Yang and Shihao Li and Yanghai Wang and Xintao Wang and Houyi Li and Wei Ji and Pengfei Wan and Steven Huang and Zhaoxiang Zhang and Jiaheng Liu},
journal= {arXiv preprint arXiv:2511.07250},
year = {2025}
}