基于多模态时间对比学习的长视频-语言预训练
计算机视觉与模式识别
2023-03-03 v2
摘要
大规模视频-语言预训练已在视频-语言理解任务中显示出显著改进。以往的视频-语言预训练研究主要关注短形式视频(即30秒以内)和句子,长形式视频-语言预训练鲜有探索。直接从长形式视频和语言中学习表征可能有益于许多长形式视频-语言理解任务。然而,由于建模长程关系的困难以及更多帧带来的沉重计算负担,这是具有挑战性的。在本文中,我们引入了长形式视频-语言预训练模型(LF-VILA),并在由现有公共数据集构建的大规模长形式视频和段落数据集上对其进行训练。为了有效捕捉丰富的时间动态并以高效的端到端方式更好地对齐视频和语言,我们在LF-VILA模型中引入了两种新颖设计。我们首先提出多模态时间对比(MTC)损失,通过鼓励长形式视频与段落之间的细粒度对齐来学习跨不同模态的时间关系。其次,我们提出层次化时间窗口注意力(HTWA)机制,以在Transformer中有效捕捉长程依赖的同时降低计算成本。我们在段落到视频检索和长形式视频问答这七项下游长形式视频-语言理解任务上微调预训练的LF-VILA模型,并取得了新的最先进性能。具体而言,我们的模型在ActivityNet段落到视频检索任务上实现了16.1%的相对提升,在How2QA任务上实现了2.4%的相对提升。我们在 https://github.com/microsoft/XPretrain 发布了我们的代码、数据集和预训练模型。
引用
@article{arxiv.2210.06031,
title = {Long-Form Video-Language Pre-Training with Multimodal Temporal Contrastive Learning},
author = {Yuchong Sun and Hongwei Xue and Ruihua Song and Bei Liu and Huan Yang and Jianlong Fu},
journal= {arXiv preprint arXiv:2210.06031},
year = {2023}
}
备注
Accepted by NeurIPS 2022