动态令牌归一化改进视觉 Transformer
计算机视觉与模式识别
2022-10-17 v2 人工智能
摘要
Vision Transformer(ViT)及其变体(如 Swin、PVT)因能学习长程上下文信息,在各种计算机视觉任务中取得巨大成功。层归一化(LN)是这些模型的关键组件。然而,我们发现普通 LN 在每个令牌内对嵌入进行归一化,使不同位置的令牌在量级上趋于相似。Transformer 难以借助 LN 捕捉诸如图像中位置上下文的归纳偏置。我们通过提出一种称为动态令牌归一化(DTN)的新归一化器来解决该问题,其在每个令牌内(令牌内)与跨不同令牌(令牌间)均执行归一化。DTN 具有若干优点。首先,它基于统一公式构建,因而可表示多种现有归一化方法。其次,DTN 以令牌内与令牌间两种方式学习归一化令牌,使 Transformer 能同时捕捉全局上下文信息与局部位置上下文。第三,仅需替换 LN 层,DTN 即可便捷嵌入各类视觉 Transformer,如 ViT、Swin、PVT、LeViT、T2T-ViT、BigBird 与 Reformer。大量实验表明,配备 DTN 的 Transformer 以极少的额外参数与计算开销持续优于基线模型。例如,DTN 在 ImageNet 上以 - 的 top-1 准确率优于 LN,在 COCO 基准目标检测中以 - box AP 占优,在 ImageNet-C 鲁棒性实验中以 - mCE 领先,在 Long-Range Arena 的 Long ListOps 中以 - 准确率胜出。代码将公开于 \url{https://github.com/wqshao126/DTN}
引用
@article{arxiv.2112.02624,
title = {Dynamic Token Normalization Improves Vision Transformers},
author = {Wenqi Shao and Yixiao Ge and Zhaoyang Zhang and Xuyuan Xu and Xiaogang Wang and Ying Shan and Ping Luo},
journal= {arXiv preprint arXiv:2112.02624},
year = {2022}
}
备注
Published at ICLR'22; 18 pages, 12 Tables, 9 Figures