VideoMAE V2:通过双重掩码扩展视频掩码自编码器
计算机视觉与模式识别
2023-04-19 v2 机器学习
摘要
规模是构建能够很好地泛化到各种下游任务的强大基础模型的首要因素。然而,训练具有数十亿参数的视频基础模型仍然具有挑战性。本文表明,视频掩码自编码器(VideoMAE)是一种可扩展且通用的自监督预训练器,用于构建视频基础模型。我们通过一个核心设计在模型和数据两个层面上扩展 VideoMAE。具体而言,我们提出一种用于高效预训练的双重掩码策略,其中编码器在视频令牌的一个子集上运行,而解码器处理视频令牌的另一个子集。尽管由于编码器中的高掩码率使得 VideoMAE 非常高效,掩码解码器仍可进一步降低整体计算成本。这使得视频中十亿级模型的高效预训练成为可能。我们还使用了一种渐进式训练范式,包括先在多样化的多源无标签数据集上预训练,然后在混合有标签数据集上进行后预训练。最终,我们成功训练了一个具有十亿参数的视频 ViT 模型,在 Kinetics(K400 上 90.0%,K600 上 89.9%)和 Something-Something(V1 上 68.7%,V2 上 77.0%)数据集上取得了新的最先进性能。此外,我们在多种下游任务上广泛验证了预训练的视频 ViT 模型,证明了其作为通用视频表征学习器的有效性。代码和模型可在 \url{https://github.com/OpenGVLab/VideoMAEv2} 获取。
引用
@article{arxiv.2303.16727,
title = {VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking},
author = {Limin Wang and Bingkun Huang and Zhiyu Zhao and Zhan Tong and Yinan He and Yi Wang and Yali Wang and Yu Qiao},
journal= {arXiv preprint arXiv:2303.16727},
year = {2023}
}
备注
CVPR 2023 camera-ready version