中文

冻结于时间:用于端到端检索的联合视频与图像编码器

计算机视觉与模式识别 2022-05-16 v2

摘要

本工作的目标是视频-文本检索——尤其是一个能够实现高效文本到视频检索的联合嵌入。该领域的挑战包括视觉架构的设计以及训练数据的性质,因为现有大规模视频-文本训练数据集(如 HowTo100M)含有噪声,因而仅能在大规模下通过大量计算获得有竞争力的性能。我们在本文中同时应对这两项挑战。我们提出了一种端到端可训练模型,旨在利用大规模图像与视频字幕数据集。我们的模型是对近期 ViT 与 Timesformer 架构的适配与扩展,由空间与时间上的注意力组成。该模型灵活,可独立或联合地在图像与视频文本数据集上训练,并采用课程学习调度:先将图像视为视频的“冻结”快照,随后在视频数据集上训练时逐渐学习关注增长的时序上下文。我们还提供了一个新的视频-文本预训练数据集 WebVid-2M,包含从互联网抓取的超过两百万个带弱字幕的视频。尽管训练数据集规模小一个数量级,我们表明该方法在标准下游视频检索基准(包括 MSR-VTT、MSVD、DiDeMo 和 LSMDC)上取得了最先进(SOTA)结果。

关键词

引用

@article{arxiv.2104.00650,
  title  = {Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval},
  author = {Max Bain and Arsha Nagrani and Gül Varol and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2104.00650},
  year   = {2022}
}

备注

ICCV 2021. Update: Scaling up extension, WebVid10M release