VideoMAE:掩码自编码器作为自监督视频预训练的数据高效学习器
计算机视觉与模式识别
2022-10-19 v3
摘要
在超大规模额外数据集上预训练视频 Transformer 通常是在相对较小的数据集上取得一流性能所必需的。本文中,我们展示视频掩码自编码器(VideoMAE)是自监督视频预训练(SSVP)的数据高效学习器。我们受近期 ImageMAE 启发,提出定制化的视频管状掩码并采用极高掩码率。这一简洁设计使视频重建成为更具挑战性的自监督任务,从而鼓励在该预训练过程中提取更有效的视频表征。我们在 SSVP 上获得三点重要发现:(1)极高掩码比例(即 90% 至 95%)仍可使 VideoMAE 取得良好性能。时间冗余的视频内容使得其掩码率可高于图像。(2)VideoMAE 在极小的数据集(约 3k-4k 视频)上无需使用任何额外数据即取得令人印象深刻的結果。(3)VideoMAE 表明对于 SSVP,数据质量比数据数量更重要。预训练与目标任务数据集间的领域偏移是一个重要问题。值得注意的是,我们的 VideoMAE 配合原生 ViT 在无需任何额外数据的情况下,可在 Kinetics-400 上取得 87.4%、Something-Something V2 上 75.4%、UCF101 上 91.3%、HMDB51 上 62.6% 的准确率。代码见 https://github.com/MCG-NJU/VideoMAE。
引用
@article{arxiv.2203.12602,
title = {VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training},
author = {Zhan Tong and Yibing Song and Jue Wang and Limin Wang},
journal= {arXiv preprint arXiv:2203.12602},
year = {2022}
}
备注
NeurIPS 2022 camera-ready version