基于显著位置的注意力网络用于图像分类
计算机视觉与模式识别
2021-06-10 v1
摘要
自注意力机制因其建模长程依赖的最重要优势而广受关注,其在计算机视觉任务中的变体——非局部块试图建模输入特征图的全局依赖。汇聚全局上下文信息将不可避免地需要大量内存与计算资源,这在过去数年已被广泛研究。然而,自注意力方案存在一个更进一步的问题:从全局范围汇聚的所有信息是否都有助于上下文建模?据我们所知,极少研究关注该问题。针对这两个问题,本文提出基于显著位置的注意力方案SPANet,其受自注意力方案中生成的注意力图与亲和矩阵的一些有趣观察启发。我们相信这些观察有助于更好地理解自注意力。SPANet使用显著位置选择算法仅在注意力图计算中选取有限数量的显著点进行关注。该方法不仅节省大量内存与计算资源,也试图从输入特征图的变换中提炼正向信息。在实现中,考虑到具有高通道维度的特征图完全不同于一般视觉图像,我们取特征图沿通道维度的平方幂作为位置的显著性度量。总体而言,不同于非局部块方法,SPANet仅使用所选位置而非全部位置、沿通道维度而非空间维度来建模上下文信息。我们的源代码见于https://github.com/likyoo/SPANet。
引用
@article{arxiv.2106.04996,
title = {Salient Positions based Attention Network for Image Classification},
author = {Sheng Fang and Kaiyu Li and Zhe Li},
journal= {arXiv preprint arXiv:2106.04996},
year = {2021}
}