中文

CG-Bench:面向长视频理解的线索锚定问答基准

计算机视觉与模式识别 2024-12-17 v1

摘要

大多数针对多模态大语言模型 (MLLMs) 的现有视频理解基准仅关注短视频。数量有限的长视频理解基准通常仅依赖于多项选择题 (MCQs)。然而,由于基于 MCQ 评估的固有局限性以及 MLLMs 推理能力的提升,模型可以纯粹通过将短视频理解与排除法相结合来给出当前答案,而无需真正理解视频内容。为了填补这一空白,我们引入了 CG-Bench,一个专为长视频中线索锚定问答设计的新型基准。CG-Bench 强调模型为问题检索相关线索的能力,从而提升评估的可信度。它包含 1,219 个手动标注的视频,通过一个细粒度分类系统进行分类,包含 14 个主类别、171 个次类别和 638 个三级类别,使其成为最大的长视频分析基准。该基准包含 12,129 个问答对,分为三大主要问题类型:感知、推理和幻觉。为了弥补纯基于 MCQ 评估的缺陷,我们设计了两种新颖的基于线索的评估方法:线索锚定白盒评估和黑盒评估,以评估模型是否基于对视频的正确理解来生成答案。我们在 CG-Bench 上评估了多个闭源和开源 MLLMs。结果表明,当前模型在理解长视频方面显著逊于短视频,且开源模型与商业模型之间存在显著差距。我们希望 CG-Bench 能够推动开发更值得信赖且能力更强的长视频理解 MLLMs。所有标注和视频数据均已发布于 https://cg-bench.github.io/leaderboard/。

关键词

引用

@article{arxiv.2412.12075,
  title  = {CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding},
  author = {Guo Chen and Yicheng Liu and Yifei Huang and Yuping He and Baoqi Pei and Jilan Xu and Yali Wang and Tong Lu and Limin Wang},
  journal= {arXiv preprint arXiv:2412.12075},
  year   = {2024}
}

备注

14 pages, 9 figures