中文

掩码视频蒸馏:重新思考自监督视频表征学习中的掩码特征建模

计算机视觉与模式识别 2023-03-08 v2

摘要

得益于掩码视觉建模,自监督视频表征学习取得了显著进展。然而,现有方法侧重于通过重建原始像素RGB值等低级特征来从零开始学习表征。本文提出掩码视频蒸馏(MVD),一种简单而有效的两阶段掩码特征建模框架用于视频表征学习:首先我们通过恢复掩码块(patch)的低级特征来预训练图像(或视频)模型,然后将所得特征作为掩码特征建模的目标。对于教师模型的选择,我们观察到由视频教师教导的学生在时序密集型视频任务上表现更好,而图像教师为空间密集型视频任务迁移了更强的空间表征。可视化分析也表明不同教师为学生产生不同的学习模式。受此观察启发,我们为MVD设计了一种时空协同教学方法。具体而言,我们通过掩码特征建模从视频教师和图像教师中蒸馏学生模型。大量实验结果表明,采用时空协同教学预训练的视频Transformer在众多视频数据集上优于使用单一教师蒸馏的模型。我们的MVD结合 vanilla ViT 在多个具有挑战性的视频下游任务上相比先前监督或自监督方法取得了最先进(SOTA)性能。例如,使用 ViT-Large 模型,我们的MVD在 Kinetics-400 和 Something-Something-v2 上分别取得86.4%和76.7%的Top-1准确率,分别超越 VideoMAE 1.2%和2.4%。当采用更大的 ViT-Huge 模型时,MVD在 Something-Something-v2 上以77.3%的Top-1准确率和在 AVA v2.2 上以41.1 mAP取得最先进性能。代码将发布于 \url{https://github.com/ruiwang2021/mvd}。

关键词

引用

@article{arxiv.2212.04500,
  title  = {Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning},
  author = {Rui Wang and Dongdong Chen and Zuxuan Wu and Yinpeng Chen and Xiyang Dai and Mengchen Liu and Lu Yuan and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2212.04500},
  year   = {2023}
}

备注

CVPR 2023, code will be available at https://github.com/ruiwang2021/mvd