中文

ELSA:面向视觉 Transformer 的增强型局部自注意力

计算机视觉与模式识别 2021-12-24 v1 人工智能 多媒体

摘要

自注意力在建模长程依赖方面很强大,但在局部更细粒度特征学习方面较弱。局部自注意力(LSA)的性能仅与卷积相当,且不如动态滤波器,这使研究者困惑于是否应使用 LSA 或其对应方法、哪一种更好,以及是什么导致 LSA 表现平庸。为澄清这些问题,我们从\emph{通道设置}与\emph{空间处理}两个方面对 LSA 及其对应方法进行了全面研究。我们发现问题关键在于空间注意力的生成与应用,其中相对位置嵌入与邻域滤波器应用是决定性因素。基于这些发现,我们提出了增强型局部自注意力(ELSA),其包含 Hadamard 注意力与 ghost head。Hadamard 注意力引入 Hadamard 乘积,在邻域情形下高效生成注意力,同时保持高阶映射。ghost head 将注意力图与静态矩阵结合以提升通道容量。实验证明了 ELSA 的有效性。在不修改架构/超参数的情况下,将 LSA 直接替换为 ELSA 可使 Swin Transformer \cite{swin} 的 top-1 准确率提升高达 +1.4。ELSA 也持续有益于 VOLO \cite{volo}(从 D1 到 D5),其中 ELSA-VOLO-D5 在 ImageNet-1K 上无需额外训练图像即达到 87.2。此外,我们在下游任务中评估了 ELSA。在 COCO 上,ELSA 将基线显著提升高达 +1.9 box Ap / +1.3 mask Ap;在 ADE20K 上高达 +1.9 mIoU。代码见 \url{https://github.com/damo-cv/ELSA}。

关键词

引用

@article{arxiv.2112.12786,
  title  = {ELSA: Enhanced Local Self-Attention for Vision Transformer},
  author = {Jingkai Zhou and Pichao Wang and Fan Wang and Qiong Liu and Hao Li and Rong Jin},
  journal= {arXiv preprint arXiv:2112.12786},
  year   = {2021}
}

备注

Project at \url{https://github.com/damo-cv/ELSA}