掩码自编码器是可扩展的视觉学习器
计算机视觉与模式识别
2021-12-21 v3
摘要
本文表明掩码自编码器(MAE)是可扩展的自监督计算机视觉学习器。我们的MAE方法很简单:我们掩码输入图像的随机块并重建缺失的像素。它基于两个核心设计。首先,我们开发了一种非对称编码器-解码器架构,其中编码器仅对可见块子集(不含掩码令牌)操作,并配有一个轻量解码器,从潜表示和掩码令牌重建原始图像。其次,我们发现掩码输入图像的高比例(例如75%)会产生一个非平凡且有意义的自监督任务。结合这两个设计使我们能高效且有效地训练大型模型:我们加速训练(3倍或更多)并提升精度。我们的可扩展方法允许学习泛化良好的高容量模型:例如,一个原生ViT-Huge模型仅使用ImageNet-1K数据的方法中取得了最佳精度(87.8%)。在下游任务中的迁移性能优于有监督预训练,并展现出有前景的缩放行为。
引用
@article{arxiv.2111.06377,
title = {Masked Autoencoders Are Scalable Vision Learners},
author = {Kaiming He and Xinlei Chen and Saining Xie and Yanghao Li and Piotr Dollár and Ross Girshick},
journal= {arXiv preprint arXiv:2111.06377},
year = {2021}
}
备注
Tech report. arXiv v2: add more transfer learning results; v3: add robustness evaluation