DeepViT:迈向更深的视觉 Transformer
计算机视觉与模式识别
2021-04-20 v4
摘要
视觉 Transformer(ViT)近来已成功应用于图像分类任务。在本文中,我们表明,与可通过堆叠更多卷积层来提升性能的卷积神经网络(CNN)不同,ViT 在加深时性能会迅速饱和。更具体地,我们通过实验观察到这种缩放困难是由注意力崩溃问题引起的:随着 Transformer 加深,注意力图逐渐变得相似,甚至在若干层后几乎完全相同。换言之,在深层 ViT 模型的顶层,特征图趋于一致。这一事实表明,在 ViT 的更深层中,自注意力机制未能学习到用于表征学习的有效概念,并阻碍了模型获得预期的性能提升。基于上述观察,我们提出了一种简单而有效的方法,称为重注意力(Re-attention),以重新生成注意力图,在不同层增加其多样性,且计算与内存开销可忽略。所提方法通过对现有 ViT 模型进行微小修改,使训练更深的 ViT 模型并取得持续性能提升成为可能。值得注意的是,当训练具有 32 个 Transformer 块的深层 ViT 模型时,在 ImageNet 上 Top-1 分类准确率可提升 1.6%。代码已公开于 https://github.com/zhoudaquan/dvit_repo。
引用
@article{arxiv.2103.11886,
title = {DeepViT: Towards Deeper Vision Transformer},
author = {Daquan Zhou and Bingyi Kang and Xiaojie Jin and Linjie Yang and Xiaochen Lian and Zihang Jiang and Qibin Hou and Jiashi Feng},
journal= {arXiv preprint arXiv:2103.11886},
year = {2021}
}