中文

SimVTP:基于掩码自编码器的简易视频文本预训练

计算机视觉与模式识别 2022-12-08 v1

摘要

本文提出 SimVTP:一种通过掩码自编码器的简易视频-文本预训练框架。我们随机掩码输入视频的时空管与输入文本的词语 token,随后将其送入统一自编码器以重建缺失的像素与词语。我们的 SimVTP 具有若干特性:1)得益于统一自编码器,SimVTP 借助另一模态重建某一模态的掩码信号,从而隐式学习视频管与文本 token 之间的跨模态对齐。2)SimVTP 不仅因视频的时间冗余而受益于高视频掩码率(如 90%),还需要高文本掩码率(如 75%),远高于 BERT(如 15%)以达到最优性能。这是因为视频模态的辅助使文本重建挑战性降低,因而需要更高掩码率以使 pretext 任务更难,从而利于有用特征学习。3)为 SimVTP 配备视频-文本对比学习(VTC)与视频-文本匹配(VTM)这两种常用跨模态训练策略,可显著提升可迁移性能。4)SimVTP 数据高效,例如在 WebVid-2M 仅 10% 数据上预训练,SimVTP 在 MSRVTT 上取得惊人好结果(43.8 R@1),远超近期在 CC3M 与 WebVid-2M 上预训练的 SOTA 方法。我们将预训练模型迁移至多种下游任务并取得优越性能。代码与模型将于 https://github.com/mayuelala/SimVTP 发布。

关键词

引用

@article{arxiv.2212.03490,
  title  = {SimVTP: Simple Video Text Pre-training with Masked Autoencoders},
  author = {Yue Ma and Tianyu Yang and Yin Shan and Xiu Li},
  journal= {arXiv preprint arXiv:2212.03490},
  year   = {2022}
}

备注

Github: https://github.com/mayuelala/SimVTP