掩码自编码器是缓解Transformer数据饥渴的有效方案
计算机视觉与模式识别
2023-01-11 v5
摘要
Vision Transformers (ViTs) 凭借其全局建模能力在多项视觉任务中优于卷积神经网络 (CNNs)。然而,ViT 缺乏卷积固有的归纳偏置,使其需要大量数据进行训练。这导致 ViT 在医学和科学等小数据集上表现不如 CNNs。我们通过实验发现,掩码自编码器 (MAE) 能使 transformer 更关注图像本身,从而在一定程度上缓解 ViT 的数据饥渴问题。但当前 MAE 模型过于复杂,在小数据集上导致过拟合问题,这使得在小数据集上训练的 MAE 与先进 CNNs 模型之间仍存在差距。因此,我们研究了如何降低 MAE 中的解码器复杂度,并为其找到了更适合小数据集的架构配置。此外,我们额外设计了位置预测任务和对比学习任务,为 MAE 引入定位与不变性特征。我们的对比学习任务不仅使模型能够学习高层视觉信息,还允许对 MAE 的 class token 进行训练,这是大多数 MAE 改进工作所未考虑的。大量实验表明,与当前流行的掩码图像建模 (MIM) 及面向小数据集的视觉 transformer 相比,我们的方法在标准小数据集以及少样本医学数据集上均展现出最先进的性能。代码与模型见 https://github.com/Talented-Q/SDMAE。
引用
@article{arxiv.2212.05677,
title = {Masked autoencoders are effective solution to transformer data-hungry},
author = {Jiawei Mao and Honggu Zhou and Xuesong Yin and Yuanqi Chang. Binling Nie. Rui Xu},
journal= {arXiv preprint arXiv:2212.05677},
year = {2023}
}