中文

MMBench-Video:用于整体视频理解的长式多镜头基准

计算机视觉与模式识别 2024-10-31 v3 多媒体

摘要

大型视觉语言模型 (LVLMs) 的兴起推动了其在多模态情境中的应用,尤其是视频理解。尽管提供定量指标的传统 VideoQA基准,但往往未涵盖视频内容的整个谱系,且不足以评估模型的时间理解能力。为此,我们引入 MMBench-Video,一个旨�严评估 LVLMs 在视频理解方面专业能力的定量基准。MMBench-Video 包含来自 YouTube 的长视频,并采用自由形式问题,模拟实际应用场景。该基准精心构建,用于探测模型的时间推理技能,所有问题均根据精心构建的能力分类进行人工标注。我们采用 GPT-4 进行自动评估,显示其在先前基于 LLM 的评估中具有更高的准确率和鲁棒性。利用 MMBench-Video,我们进行了包括众所周知和开源 LVLMs 在内的图像和视频的全面评估。MMBench-Video 是研究社区的一个宝贵资源,促进了 LVLMs 和视频理解领域的进步。MMBench-Video 的评估代码将集成到 VLMEvalKit: https://github.com/open-compass/VLMEvalKit。

关键词

引用

@article{arxiv.2406.14515,
  title  = {MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding},
  author = {Xinyu Fang and Kangrui Mao and Haodong Duan and Xiangyu Zhao and Yining Li and Dahua Lin and Kai Chen},
  journal= {arXiv preprint arXiv:2406.14515},
  year   = {2024}
}

备注

Accepted in NeurIPS 2024 Datasets and Benchmarks Track