中文

提升长时段视频理解基准的 Neptune

机器学习 2025-01-22 v2 人工智能 计算机视觉与模式识别

摘要

我们介绍了 Neptune,这是一个用于长视频理解的基准测试,要求在长时间范围内进行推理并跨越不同模态。许多现有的视频数据集和模型专注于短片段(10秒至30秒)。尽管存在一些长视频数据集,但它们往往可以仅通过对视频中少数帧应用强大的图像模型来解决,且通常需要高成本的人工标注。在此基础上,我们提出了一种可扩展的数据集创建管道,利用大型模型(VLM 和 LLM)自动生成稠密、时间对齐的视频标题,以及用于视频片段(最长达15分钟)的艰难问答干扰选项。Neptune 数据集涵盖了广泛的长视频推理能力,并包含一子集强调跨模态推理。由于现有开放式问答指标要么基于规则,要么依赖专有模型,本文提供了新的开源模型基准 GEM,用于对 Neptune 上开放式响应进行评分。基准评估显示,大多数当前开源长视频模型在 Neptune 上表现不佳,尤其是针对测试时间顺序、计数和状态变化问题的表现。通过 Neptune,我们旨�推动更先进模型能够理解长视频的开发。数据集可在 https://github.com/google-deepmind/neptune 获取。

关键词

引用

@article{arxiv.2412.09582,
  title  = {Neptune: The Long Orbit to Benchmarking Long Video Understanding},
  author = {Arsha Nagrani and Mingda Zhang and Ramin Mehran and Rachel Hornung and Nitesh Bharadwaj Gundavarapu and Nilpa Jha and Austin Myers and Xingyi Zhou and Boqing Gong and Cordelia Schmid and Mikhail Sirotenko and Yukun Zhu and Tobias Weyand},
  journal= {arXiv preprint arXiv:2412.09582},
  year   = {2025}
}