中文

MAR:面向高效动作识别的掩码自编码器

计算机视觉与模式识别 2022-07-26 v1

摘要

视频识别的标准方法通常对完整输入视频进行操作,由于视频中广泛存在的时空冗余,这种做法效率低下。掩码视频建模(即 VideoMAE)的近期进展已表明,普通视觉Transformer(ViT)在仅给定有限视觉内容时具备补全时空上下文的能力。受此启发,我们提出掩码动作识别(MAR),其通过丢弃一部分图像块并仅对视频的一部分进行操作来减少冗余计算。MAR 包含以下两个不可或缺的组件:单元滚动掩码与桥接分类器。具体而言,为使 ViT 易于感知可见图像块之外的细节,提出单元滚动掩码以保留视频中的时空相关性,确保同一空间位置的图像块可依次被观测以便于重建。此外,我们注意到,尽管部分观测特征可重建语义明确的不可见图像块,却无法实现准确分类。为此,提出桥接分类器以弥合用于重建的 ViT 编码特征与专用于分类的特征之间的语义鸿沟。我们提出的 MAR 将 ViT 的计算成本降低了 53%,大量实验表明 MAR 始终以显著优势优于现有 ViT 模型。特别地,我们发现由 MAR 训练的 ViT-Large 在 Kinetics-400 与 Something-Something v2 数据集上均以令人信服的优势优于由标准训练方案训练的 ViT-Huge,而我们的 ViT-Large 计算开销仅为 ViT-Huge 的 14.5%。

关键词

引用

@article{arxiv.2207.11660,
  title  = {MAR: Masked Autoencoders for Efficient Action Recognition},
  author = {Zhiwu Qing and Shiwei Zhang and Ziyuan Huang and Xiang Wang and Yuehuan Wang and Yiliang Lv and Changxin Gao and Nong Sang},
  journal= {arXiv preprint arXiv:2207.11660},
  year   = {2022}
}