中文

VIMPAC:基于掩码词元预测与对比学习的视频预训练

计算机视觉与模式识别 2021-06-22 v1 人工智能 机器学习

摘要

视频理解依赖于感知全局内容并建模其内部关联(例如因果、运动和时空对应)。为学习这些交互,我们在通过 VQ-VAE 生成的离散化视频词元上应用掩码后预测预训练任务。与文本词元较为独立不同,相邻视频词元通常具有强相关性(例如连续视频帧通常看起来非常相似),因此均匀掩码单个词元会使任务过于简单,难以学到有用的表示。为处理该问题,我们提出一种块级掩码策略,在空间和时间域上同时掩码相邻视频词元。我们还加入一种无增强的对比学习方法,通过预测视频片段是否采样自同一视频来进一步捕捉全局内容。我们在未筛选视频上预训练模型,并表明我们的预训练模型能在多个视频理解数据集(例如 SSV2、Diving48)上达到最先进结果。最后,我们提供关于模型可扩展性与预训练方法设计的详细分析。代码发布于 https://github.com/airsplay/vimpac。

关键词

引用

@article{arxiv.2106.11250,
  title  = {VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning},
  author = {Hao Tan and Jie Lei and Thomas Wolf and Mohit Bansal},
  journal= {arXiv preprint arXiv:2106.11250},
  year   = {2021}
}

备注

Under review, 23 Pages