中文

面向更深视觉Transformer扩展的掩码图像残差学习

计算机视觉与模式识别 2023-11-16 v3

摘要

更深的视觉Transformer(ViT)训练难度更大。我们揭示了在使用掩码图像建模(MIM)进行预训练时,ViT更深层中出现的退化问题。为缓解更深ViT的训练困难,我们提出了一种称为掩码图像残差学习(MIRL)的自监督学习框架,该框架显著减轻了退化问题,使得沿深度方向扩展ViT成为性能提升的可行途径。我们将ViT更深层的预训练目标重新表述为学习恢复掩码图像的残差。我们提供了大量实证证据表明,更深的ViT可通过MIRL得到有效优化,并易于从深度增加而获得精度提升。在与ViT-Base和ViT-Large同等计算复杂度下,我们实例化了4.5×\times和2×\times更深的ViT,称为ViT-S-54和ViT-B-48。更深的ViT-S-54耗费比ViT-Large少3×\times,却取得了与ViT-Large相当的性能。ViT-B-48在ImageNet上达到了86.2%的top-1准确率。一方面,经MIRL预训练的更深ViT在目标检测和语义分割等下游任务上展现出优异的泛化能力。另一方面,MIRL表现出很高的预训练效率。在更少的预训练时间内,MIRL相较于其他方法取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2309.14136,
  title  = {Masked Image Residual Learning for Scaling Deeper Vision Transformers},
  author = {Guoxi Huang and Hongtao Fu and Adrian G. Bors},
  journal= {arXiv preprint arXiv:2309.14136},
  year   = {2023}
}