中文

CinePile:一个长视频问答数据集与基准

计算机视觉与模式识别 2024-10-22 v3 机器学习 多媒体

摘要

当前的长视频理解数据集往往无法提供真正的长视频理解挑战,因为源自这些数据集的许多任务仅需分析视频中的一帧或几帧随机帧即可成功解决。为解决这一问题,我们提出了一个专为真实长视频理解设计的新颖数据集与基准 CinePile。本文详细介绍了我们创建问答数据集的创新方法,该方法利用先进的 LLM 并结合人在回路,且建立在人类生成的原始数据之上。我们的综合数据集包含 305,000 道多项选择题 (MCQs),涵盖各种视觉和多模态方面,包括时序理解、人-物交互理解以及对场景内事件或动作的推理。此外,我们在训练集上微调了开源 Video-LLM,并在我们数据集的测试集上评估了开源和专有的以视频为中心的 LLM。结果表明,尽管当前模型的表现不及人类,但微调这些模型可以显著提升其性能。

关键词

引用

@article{arxiv.2405.08813,
  title  = {CinePile: A Long Video Question Answering Dataset and Benchmark},
  author = {Ruchit Rawal and Khalid Saifullah and Miquel Farré and Ronen Basri and David Jacobs and Gowthami Somepalli and Tom Goldstein},
  journal= {arXiv preprint arXiv:2405.08813},
  year   = {2024}
}

备注

Project page with all the artifacts - https://ruchitrawal.github.io/cinepile/. Updated version with adversarial refinement pipeline and more model evaluations