中文

BEVT:视频 Transformer 的 BERT 预训练

计算机视觉与模式识别 2022-03-04 v3 机器学习

摘要

本文研究视频 Transformer 的 BERT 预训练。鉴于近期图像 Transformer 的 BERT 预训练取得成功,这是一个直接但值得研究的扩展。我们引入 BEVT,将视频表示学习解耦为空间表示学习与时序动态学习。具体而言,BEVT 首先在图像数据上执行掩码图像建模,然后在视频数据上联合进行掩码图像建模与掩码视频建模。该设计源于两点观察:1)在图像数据集上学习的 Transformer 提供了良好的空间先验,可缓解视频 Transformer 的学习难度,若从头训练往往计算密集;2)由于较大的类内与类间差异,做出正确预测所需的判别线索(即空间与时序信息)在不同视频间变化。我们在三个具挑战性的视频基准上进行了广泛实验,BEVT 取得了非常有前景的结果。在主要依赖判别性空间表示的 Kinetics 400 上,BEVT 取得了与强监督基线相当的结果。在包含依赖时序动态视频的 Something-Something-V2 和 Diving 48 上,BEVT 以明显优势超越所有替代基线,并以 71.4% 和 87.2% 的 Top-1 准确率分别实现最先进性能。代码将发布于 \url{https://github.com/xyzforever/BEVT}。

关键词

引用

@article{arxiv.2112.01529,
  title  = {BEVT: BERT Pretraining of Video Transformers},
  author = {Rui Wang and Dongdong Chen and Zuxuan Wu and Yinpeng Chen and Xiyang Dai and Mengchen Liu and Yu-Gang Jiang and Luowei Zhou and Lu Yuan},
  journal= {arXiv preprint arXiv:2112.01529},
  year   = {2022}
}

备注

To Appear at CVPR 2022, code is available at https://github.com/xyzforever/BEVT