中文

动态令牌归一化改进视觉 Transformer

计算机视觉与模式识别 2022-10-17 v2 人工智能

摘要

Vision Transformer(ViT)及其变体(如 Swin、PVT)因能学习长程上下文信息,在各种计算机视觉任务中取得巨大成功。层归一化(LN)是这些模型的关键组件。然而,我们发现普通 LN 在每个令牌内对嵌入进行归一化,使不同位置的令牌在量级上趋于相似。Transformer 难以借助 LN 捕捉诸如图像中位置上下文的归纳偏置。我们通过提出一种称为动态令牌归一化(DTN)的新归一化器来解决该问题,其在每个令牌内(令牌内)与跨不同令牌(令牌间)均执行归一化。DTN 具有若干优点。首先,它基于统一公式构建,因而可表示多种现有归一化方法。其次,DTN 以令牌内与令牌间两种方式学习归一化令牌,使 Transformer 能同时捕捉全局上下文信息与局部位置上下文。第三,仅需替换 LN 层,DTN 即可便捷嵌入各类视觉 Transformer,如 ViT、Swin、PVT、LeViT、T2T-ViT、BigBird 与 Reformer。大量实验表明,配备 DTN 的 Transformer 以极少的额外参数与计算开销持续优于基线模型。例如,DTN 在 ImageNet 上以 0.5%0.5\% - 1.2%1.2\% 的 top-1 准确率优于 LN,在 COCO 基准目标检测中以 1.21.2 - 1.41.4 box AP 占优,在 ImageNet-C 鲁棒性实验中以 2.3%2.3\% - 3.9%3.9\% mCE 领先,在 Long-Range Arena 的 Long ListOps 中以 0.5%0.5\% - 0.8%0.8\% 准确率胜出。代码将公开于 \url{https://github.com/wqshao126/DTN}

关键词

引用

@article{arxiv.2112.02624,
  title  = {Dynamic Token Normalization Improves Vision Transformers},
  author = {Wenqi Shao and Yixiao Ge and Zhaoyang Zhang and Xuyuan Xu and Xiaogang Wang and Ying Shan and Ping Luo},
  journal= {arXiv preprint arXiv:2112.02624},
  year   = {2022}
}

备注

Published at ICLR'22; 18 pages, 12 Tables, 9 Figures