中文

作为时空学习器的掩码自编码器

计算机视觉与模式识别 2022-10-24 v2 机器学习

摘要

本文研究将掩码自编码器(MAE)概念上简单地扩展至视频的时空表征学习。我们随机掩码掉视频中的时空块,并学习一个自编码器在像素上重建它们。有趣的是,我们表明我们的 MAE 方法几乎无需对时空的归纳偏置(仅除块与位置嵌入外)即可学习强表征,且时空无关的随机掩码表现最佳。我们观察到最优掩码比率高达 90%(图像上为 75%),支持了該比率与数据信息冗余相关的假设。高掩码比率带来大幅加速,例如挂钟时间 >4 倍甚至更多。我们使用原生 Vision Transformers 在多个具挑战性的视频数据集上报告了有竞争力的结果。我们观察到 MAE 可以大幅优于监督预训练。我们进一步报告了在真实世界、未筛选的 Instagram 数据上训练的令人鼓舞的结果。我们的研究表明,掩码自编码(BERT、MAE 等)的通用框架可成为以最小领域知识进行表征学习的统一方法。

关键词

引用

@article{arxiv.2205.09113,
  title  = {Masked Autoencoders As Spatiotemporal Learners},
  author = {Christoph Feichtenhofer and Haoqi Fan and Yanghao Li and Kaiming He},
  journal= {arXiv preprint arXiv:2205.09113},
  year   = {2022}
}