中文

你所需的一切注意力:用于图像检索的全局-局部、空间-通道注意力

计算机视觉与模式识别 2021-07-19 v1

摘要

我们解决大规模实例级图像检索的表示学习问题。除骨干网络、训练流水线和损失函数外,流行的方法聚焦于不同的空间池化与注意力机制,它们是学习强大全局图像表示的核心。根据特征张量元素(局部与全局)的交互以及施加的维度(空间与通道),注意力有不同形式。遗憾的是,每项研究仅解决一种或两种注意力形式,并将其应用于分类、检测或检索等不同问题。我们提出全局-局部注意力模块(GLAM),它附着于骨干网络末端,并融合了全部四种注意力形式:局部与全局、空间与通道。我们得到新的特征张量,并通过空间池化学习用于图像检索的强大嵌入。聚焦于全局描述子,我们提供了所有注意力形式交互的实证证据,并在标准基准上改进了当前最优(SOTA)水平。

关键词

引用

@article{arxiv.2107.08000,
  title  = {All the attention you need: Global-local, spatial-channel attention for image retrieval},
  author = {Chull Hwan Song and Hye Joo Han and Yannis Avrithis},
  journal= {arXiv preprint arXiv:2107.08000},
  year   = {2021}
}