中文

用于图像分类的显式建模注意力图

计算机视觉与模式识别 2021-03-19 v2

摘要

自注意力网络在图像分类等计算机视觉任务中取得了显著进展。自注意力机制的主要优势在于能够捕获注意力图中的长程特征交互。然而,注意力图的计算需要可学习的键、查询和位置编码,其使用通常不够直观且计算代价高昂。为了缓解这个问题,我们提出了一种新颖的自注意力模块,该模块使用仅一个可学习参数来显式建模注意力图,以实现低计算开销。使用几何先验来显式建模注意力图的设计基于以下观察:图像中给定像素的空间上下文主要由其邻居主导,而更远的像素贡献较小。具体而言,注意力图通过简单函数(例如,高斯核)进行参数化,并带有一个可学习的半径,该半径独立于输入内容进行建模。我们的评估表明,在 ImageNet ILSVRC 中,我们的方法相比 ResNet 基线实现了高达 2.2% 的准确率提升,并且在准确率上以 0.9% 的优势超越了其他自注意力方法(如 AA-ResNet152),同时参数量减少了 6.4%,GFLOPs 减少了 6.7%。这一结果实证地表明了在图像分类中应用自注意力机制时,融入几何先验的价值。

关键词

引用

@article{arxiv.2006.07872,
  title  = {Explicitly Modeled Attention Maps for Image Classification},
  author = {Andong Tan and Duc Tam Nguyen and Maximilian Dax and Matthias Nießner and Thomas Brox},
  journal= {arXiv preprint arXiv:2006.07872},
  year   = {2021}
}

备注

Accepted by AAAI2021