深度 Transformer 渴求全频段数据
计算机视觉与模式识别
2022-11-18 v3
摘要
当前研究表明,归纳偏置(IB)可提升 Vision Transformer(ViT)性能。然而,它们同时引入了金字塔结构,以抵消因引入 IB 所带来的 FLOPs 与参数量的增加。该结构破坏了计算机视觉与自然语言处理(NLP)的统一性,并使模型复杂化。我们研究了一个称为 LSRA 的 NLP 模型,它以无金字塔结构引入了 IB。我们分析了其优于 ViT 的原因,发现引入 IB 增加了每一层中高频数据的占比,使“注意力”关注到更多信息。结果,注意力头注意到更多样的信息,表现出更优的性能。为进一步挖掘 transformer 的潜力,我们提出了 EIT,它在无金字塔结构下通过一种新颖的递减卷积结构高效地将 IB 引入 ViT。EIT 在 ImageNet-1K 上取得了与当前最优(SOTA)方法相竞争的性能,并在具有相同规模且具备无金字塔结构的模型上取得了 SOTA 性能。
引用
@article{arxiv.2203.07116,
title = {Deep Transformers Thirst for Comprehensive-Frequency Data},
author = {Rui Xia and Chao Xue and Boyu Deng and Fang Wang and Jingchao Wang},
journal= {arXiv preprint arXiv:2203.07116},
year = {2022}
}
备注
7 pages, 10 figures