MMBench-Video:用于整体视频理解的长式多镜头基准
计算机视觉与模式识别
2024-10-31 v3 多媒体
摘要
大型视觉语言模型 (LVLMs) 的兴起推动了其在多模态情境中的应用,尤其是视频理解。尽管提供定量指标的传统 VideoQA基准,但往往未涵盖视频内容的整个谱系,且不足以评估模型的时间理解能力。为此,我们引入 MMBench-Video,一个旨�严评估 LVLMs 在视频理解方面专业能力的定量基准。MMBench-Video 包含来自 YouTube 的长视频,并采用自由形式问题,模拟实际应用场景。该基准精心构建,用于探测模型的时间推理技能,所有问题均根据精心构建的能力分类进行人工标注。我们采用 GPT-4 进行自动评估,显示其在先前基于 LLM 的评估中具有更高的准确率和鲁棒性。利用 MMBench-Video,我们进行了包括众所周知和开源 LVLMs 在内的图像和视频的全面评估。MMBench-Video 是研究社区的一个宝贵资源,促进了 LVLMs 和视频理解领域的进步。MMBench-Video 的评估代码将集成到 VLMEvalKit: https://github.com/open-compass/VLMEvalKit。
引用
@article{arxiv.2406.14515,
title = {MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding},
author = {Xinyu Fang and Kangrui Mao and Haodong Duan and Xiangyu Zhao and Yining Li and Dahua Lin and Kai Chen},
journal= {arXiv preprint arXiv:2406.14515},
year = {2024}
}
备注
Accepted in NeurIPS 2024 Datasets and Benchmarks Track