视觉Transformer的增强捷径
计算机视觉与模式识别
2021-07-01 v1 机器学习
摘要
Transformer模型近来在计算机视觉任务上取得了巨大进展。视觉Transformer的快速发展主要得益于其从输入图像中提取有效特征的高表示能力。然而,主流Transformer模型采用深层架构设计,随着深度增加,特征多样性会持续降低,即特征坍塌。在本文中,我们从理论上分析了特征坍塌现象,并研究了这些Transformer模型中捷径与特征多样性之间的关系。随后,我们提出了一种增强捷径方案,在原始捷径上并行插入带有可学习参数的额外路径。为节省计算成本,我们进一步探索了一种使用块循环投影来实现增强捷径的高效方法。在基准数据集上进行的广泛实验证明了所提方法的有效性,其在不显著增加参数量和FLOPs的情况下,使最先进视觉Transformer的准确率提升约1%。
引用
@article{arxiv.2106.15941,
title = {Augmented Shortcuts for Vision Transformers},
author = {Yehui Tang and Kai Han and Chang Xu and An Xiao and Yiping Deng and Chao Xu and Yunhe Wang},
journal= {arXiv preprint arXiv:2106.15941},
year = {2021}
}