DeepMIM:面向掩码图像建模的深度监督
计算机视觉与模式识别
2023-03-17 v2
摘要
深度监督通过对神经网络的中间特征施加额外监督,在深度学习早期被广泛用于图像分类,因为它显著降低了训练难度并简化了优化,如避免相较于原始训练的梯度消失。然而,随着归一化技术和残差连接的出现,图像分类中的深度监督逐渐退出。本文中,我们重新审视用于掩码图像建模(MIM)的深度监督,MIM通过掩码并预测的 scheme 预训练 Vision Transformer (ViT)。通过实验,我们发现深度监督驱动较浅层学习更有意义的表示,加速模型收敛,并扩展注意力多样性。我们提出的方法称为DeepMIM,显著提升了每一层的表示能力。此外,DeepMIM与许多具有不同重建目标的MIM模型兼容。例如,使用ViT-B,基于MAE的DeepMIM在ImageNet上达到84.2的top-1准确率,比MAE高出+0.6。通过将DeepMIM与更强的tokenizer CLIP结合,我们的模型在各类下游任务上达到state-of-the-art性能,包括图像分类(ImageNet-1K上85.6 top-1准确率,比MAE-CLIP高出+0.8)、目标检测(COCO上52.8 APbox)和语义分割(ADE20K上53.1 mIoU)。代码和模型见 https://github.com/OliverRensu/DeepMIM。
引用
@article{arxiv.2303.08817,
title = {DeepMIM: Deep Supervision for Masked Image Modeling},
author = {Sucheng Ren and Fangyun Wei and Samuel Albanie and Zheng Zhang and Han Hu},
journal= {arXiv preprint arXiv:2303.08817},
year = {2023}
}
备注
Code and models are available at https://github.com/OliverRensu/DeepMIM