中文

具有早期全局整合的局部偏移注意力

计算机视觉与模式识别 2021-12-23 v2 人工智能

摘要

近期工作展示了 Transformer 在计算机视觉应用中的潜力。图像首先被划分为块,随后作为注意力机制的输入 token。由于注意力机制具有昂贵的二次方计算代价,要么使用较大的块尺寸从而导致粗粒度的全局交互,要么仅在图像的局部区域上应用注意力,牺牲长距离交互。在本工作中,我们提出一种方法,使得在视觉 Transformer 的早期层即可同时实现粗粒度全局交互与细粒度局部交互。我们方法的核心在于应用局部与全局注意力层。在局部注意力层中,我们对每个块及其局部偏移应用注意力,得到虚拟定位的局部块,这些块不受限于单一特定位置。这些虚拟定位的块随后被用于全局注意力层。将注意力层分离为局部与全局两部分,使得在块数量上具有较低的计算代价,同时仍支持在第一层即实现数据依赖的定位,而非其他视觉 Transformer 中的静态定位。我们的方法在 CIFAR10、CIFAR100 和 ImageNet 上的图像分类任务中优于基于卷积和基于 Transformer 的方法。代码见:https://github.com/shellysheynin/Locally-SAG-Transformer。

关键词

引用

@article{arxiv.2112.05080,
  title  = {Locally Shifted Attention With Early Global Integration},
  author = {Shelly Sheynin and Sagie Benaim and Adam Polyak and Lior Wolf},
  journal= {arXiv preprint arXiv:2112.05080},
  year   = {2021}
}