中文

视觉Transformer的增强捷径

计算机视觉与模式识别 2021-07-01 v1 机器学习

摘要

Transformer模型近来在计算机视觉任务上取得了巨大进展。视觉Transformer的快速发展主要得益于其从输入图像中提取有效特征的高表示能力。然而,主流Transformer模型采用深层架构设计,随着深度增加,特征多样性会持续降低,即特征坍塌。在本文中,我们从理论上分析了特征坍塌现象,并研究了这些Transformer模型中捷径与特征多样性之间的关系。随后,我们提出了一种增强捷径方案,在原始捷径上并行插入带有可学习参数的额外路径。为节省计算成本,我们进一步探索了一种使用块循环投影来实现增强捷径的高效方法。在基准数据集上进行的广泛实验证明了所提方法的有效性,其在不显著增加参数量和FLOPs的情况下,使最先进视觉Transformer的准确率提升约1%。

关键词

引用

@article{arxiv.2106.15941,
  title  = {Augmented Shortcuts for Vision Transformers},
  author = {Yehui Tang and Kai Han and Chang Xu and An Xiao and Yiping Deng and Chao Xu and Yunhe Wang},
  journal= {arXiv preprint arXiv:2106.15941},
  year   = {2021}
}