DAS:一种在 CNN 中捕获显著信息的可变形注意力方法
计算机视觉与模式识别
2023-11-22 v1
摘要
卷积神经网络(CNNs)擅长局部空间模式识别。对于许多视觉任务(如物体识别与分割),显著信息也存在于 CNN 的核边界之外。然而,由于感受野受限,CNN 难以捕获此类相关信息。自注意力可改善模型对全局信息的获取,但增加计算开销。我们提出一种快速且简洁的全卷积方法 DAS,有助于将注意力聚焦于相关信息。它使用可变形卷积定位相关图像区域,并使用可分离卷积提升效率。DAS 可插入现有 CNN,并通过门控机制传播相关信息。与 transformer 风格注意力 O(n^2) 的计算复杂度相比,DAS 为 O(n)。我们认为,当添加至主流 CNN 用于图像分类与物体检测时,DAS 对相关特征增强关注的能力会带来性能提升。例如,基于 ResNet50 骨干,DAS 在 Stanford Dogs(4.47%)、ImageNet(1.91%)与 COCO AP(3.3%)上均取得提升。在使用相似或更少 FLOPs 的同时,其优于其他 CNN 注意力机制。我们的代码将公开可用。
引用
@article{arxiv.2311.12091,
title = {DAS: A Deformable Attention to Capture Salient Information in CNNs},
author = {Farzad Salajegheh and Nader Asadi and Soroush Saryazdi and Sudhir Mudur},
journal= {arXiv preprint arXiv:2311.12091},
year = {2023}
}