Vid2Seq:用于密集视频描述的大规模视觉语言模型预训练
计算机视觉与模式识别
2023-03-22 v2 人工智能
计算与语言
机器学习
摘要
在这项工作中,我们介绍了Vid2Seq,一种在多模态单阶段密集事件描述模型,其在大规模现成可用的旁白视频上进行了预训练。Vid2Seq架构通过特殊时间标记增强了语言模型,使其能够在同一输出序列中无缝预测事件边界和文本描述。这种统一模型需要大规模训练数据,而当前标注数据集中并无此类数据。我们表明,可以通过将转写语音的句子边界重新表述为伪事件边界,并将转写语音句子用作伪事件描述,来利用无标注旁白视频进行密集视频描述。所得在YT-Temporal-1B数据集上预训练的Vid2Seq模型在包括YouCook2、ViTT和ActivityNet Captions在内的多种密集视频描述基准上改进了SOTA。Vid2Seq也很好地泛化到视频段落描述和视频片段描述任务,以及少样本设定。我们的代码公开于https://antoyang.github.io/vid2seq.html。
引用
@article{arxiv.2302.14115,
title = {Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning},
author = {Antoine Yang and Arsha Nagrani and Paul Hongsuck Seo and Antoine Miech and Jordi Pont-Tuset and Ivan Laptev and Josef Sivic and Cordelia Schmid},
journal= {arXiv preprint arXiv:2302.14115},
year = {2023}
}
备注
CVPR 2023 Camera-Ready; Project Webpage: https://antoyang.github.io/vid2seq.html ; 18 pages; 6 figures