中文

VindLU:高效视频-语言预训练配方

计算机视觉与模式识别 2023-04-06 v2

摘要

过去几年中,视频与语言(VidL)理解取得了显著进展。然而,大多数现代VidL方法使用复杂且专门的模型架构与精细的预训练协议,使得这些框架的可复现性、分析与比较十分困难。因此,本文不进行又一新VidL模型的提出,而是开展一项彻底的实证研究,揭示VidL模型设计中最关键的因素。我们考察的因素包括(i)时空架构设计,(ii)多模态融合方案,(iii)预训练目标,(iv)预训练数据选择,(v)预训练与微调协议,以及(vi)数据集与模型缩放。我们的实证研究揭示最重要的设计因素包括:时间建模、视频到文本多模态融合、掩码建模目标,以及图像与视频联合训练。利用这些经验见解,我们随后开发了一个逐步配方,称为VindLU,用于高效的VidL预训练。我们使用该配方训练的最终模型在多个VidL任务上取得了与最先进水平相当或更好的结果,且无需依赖外部CLIP预训练。特别是在文本到视频检索任务上,我们的方法在DiDeMo上取得61.2%,在ActivityNet上取得55.0%,分别超越当前SOTA 7.8%和6.1%。此外,我们的模型还在ActivityNet-QA、MSRVTT-QA、MSRVTT-MC和TVQA上取得了最先进的视频问答结果。我们的代码与预训练模型公开于:https://github.com/klauscc/VindLU。

关键词

引用

@article{arxiv.2212.05051,
  title  = {VindLU: A Recipe for Effective Video-and-Language Pretraining},
  author = {Feng Cheng and Xizi Wang and Jie Lei and David Crandall and Mohit Bansal and Gedas Bertasius},
  journal= {arXiv preprint arXiv:2212.05051},
  year   = {2023}
}

备注

CVPR 2023. Project page: https://klauscc.github.io/vindlu.html