位置嵌入需要独立的层归一化
计算机视觉与模式识别
2022-12-23 v2
摘要
由于自注意力操作的置换不变性,位置嵌入(PE)对视觉 Transformer(VTs)至关重要。通过使用重参数化与可视化分析 VTs 中各编码器层的输入输出,我们发现默认的 PE 加入方法(将 PE 与图像块嵌入简单相加)对令牌嵌入和 PE 施加相同的仿射变换,这限制了 PE 的表达能力,从而制约了 VTs 的性能。为克服该局限,我们提出一种简单、有效且鲁棒的方法。具体而言,我们为每层的令牌嵌入与 PE 分别提供两个独立的层归一化,并将它们相加作为每层多头自注意力模块的输入。由于该方法允许模型为不同层自适应调整 PE 的信息,我们将其命名为层自适应位置嵌入,缩写为 LaPE。大量实验表明,LaPE 能改进带有不同类型 PE 的多种 VTs,并使 VTs 对 PE 类型具有鲁棒性。例如,LaPE 在 Cifar10 上为 ViT-Lite 提升 0.94% 准确率,在 Cifar100 上为 CCT 提升 0.98%,在 ImageNet-1K 上为 DeiT 提升 1.72%,考虑到 LaPE 带来的可忽略的额外参数量、内存与计算开销,这一提升颇为显著。代码已公开于 https://github.com/Ingrid725/LaPE。
引用
@article{arxiv.2212.05262,
title = {Position Embedding Needs an Independent Layer Normalization},
author = {Runyi Yu and Zhennan Wang and Yinhuai Wang and Kehan Li and Yian Zhao and Jian Zhang and Guoli Song and Jie Chen},
journal= {arXiv preprint arXiv:2212.05262},
year = {2022}
}
备注
14 pages, 8 figures