MixMAE:面向分层视觉Transformer高效预训练的混合与掩码自编码器
计算机视觉与模式识别
2023-04-03 v4
摘要
本文提出混合与掩码自编码器(MixMAE),一种简单而高效的预训练方法,适用于多种分层视觉Transformer。现有的面向分层视觉Transformer的掩码图像建模(MIM)方法将输入token的随机子集替换为特殊的[MASK]符号,并从受损图像中重建原始图像token。然而,我们发现由于较大的掩码率(如SimMIM中的60%),使用[MASK]符号会极大拖慢训练并导致预训练-微调不一致。另一方面,MAE在其编码器中完全不引入[MASK] token,但不适用于分层视觉Transformer。为解决该问题并加速分层模型的预训练,我们将一幅图像的掩码token替换为另一幅图像的可见token,即创建混合图像。随后我们进行双重重建,从混合输入中重建两幅原始图像,显著提升了效率。尽管MixMAE可应用于多种分层Transformer,本文探索使用具有大窗口尺寸并扩展至巨型模型规模(达6亿参数)的Swin Transformer。实证结果表明,MixMAE能够高效学习高质量视觉表征。值得注意的是,使用Swin-B/W14的MixMAE在ImageNet-1K上预训练600轮后达到85.1%的top-1准确率。此外,其在另外6个数据集上的迁移性能表明,MixMAE比以往流行的MIM方法具有更优的FLOPs/性能权衡。代码见 https://github.com/Sense-X/MixMIM。
引用
@article{arxiv.2205.13137,
title = {MixMAE: Mixed and Masked Autoencoder for Efficient Pretraining of Hierarchical Vision Transformers},
author = {Jihao Liu and Xin Huang and Jinliang Zheng and Yu Liu and Hongsheng Li},
journal= {arXiv preprint arXiv:2205.13137},
year = {2023}
}
备注
CVPR2023. Code: https://github.com/Sense-X/MixMIM