VidChapters-7M:大规模视频章节数据集
计算机视觉与模式识别
2023-09-26 v1 人工智能
计算与语言
机器学习
摘要
将长视频分割为章节可使用户快速导航至感兴趣的信息。这一重要主题因缺乏公开发布的数据集而未得到充分研究。为解决此问题,我们提出 VidChapters-7M,一个包含 817K 个用户分章视频、共计 7M 章节的数据集。VidChapters-7M 通过抓取在线视频的用户标注章节以可扩展方式自动创建,因此无需任何额外人工标注。我们基于该数据引入以下三项任务。首先,视频章节生成任务包括时间上分割视频并为每个片段生成章节标题。为进一步剖析该问题,我们还定义了此任务的两种变体:给定真实边界的视频章节生成(需对给定标注视频段生成章节标题)与视频章节定位(需根据标注标题时间定位章节)。我们为这三项任务基准测试了简单基线与最先进的视频-语言模型。我们还表明,在 VidChapters-7M 上的预训练可很好地迁移至密集视频描述任务,在零样本与微调设定下大幅改进 YouCook2 与 ViTT 基准上的 SOTA。最后,我们的实验揭示下游性能随预训练数据集规模良好扩展。我们的数据集、代码与模型公开于 https://antoyang.github.io/vidchapters.html。
引用
@article{arxiv.2309.13952,
title = {VidChapters-7M: Video Chapters at Scale},
author = {Antoine Yang and Arsha Nagrani and Ivan Laptev and Josef Sivic and Cordelia Schmid},
journal= {arXiv preprint arXiv:2309.13952},
year = {2023}
}
备注
Accepted at NeurIPS 2023 Track on Datasets and Benchmarks; Project Webpage: https://antoyang.github.io/vidchapters.html ; 31 pages; 8 figures