TDAM:用于 CNN 中上下文引导特征选择的自顶向下注意力模块
计算机视觉与模式识别
2022-10-24 v3
摘要
卷积神经网络(CNN)的注意力模块是提升多种计算机视觉任务性能的有效方法。虽然现有方法能够恰当地对通道注意力、空间注意力和自注意力进行建模,但它们主要以前馈自底向上的方式运行。因此,注意力机制强烈依赖于单个输入特征图的局部信息,且未纳入较高层中可用的语义更丰富的上下文信息,而这些信息本可通过自顶向下的信息流在较低层特征图中指明“看什么以及看哪里”。因此,在这项工作中,我们提出了一个轻量级的自顶向下注意力模块(TDAM),该模块迭代地生成“视觉探照灯”,以对其输入执行通道和空间调制,并在每个计算步骤输出更具上下文相关性的特征图。我们的实验表明,TDAM 在多个物体识别基准上提升了 CNN 的性能,并且在参数和内存效率更高的情况下优于著名的注意力模块。此外,基于 TDAM 的模型学会了在每个计算步骤中“转移注意力”,即定位单个物体或特征,而无需任何显式监督,这使得 ResNet50 在弱监督物体定位任务上提升了 5%。源代码和模型公开于:https://github.com/shantanuj/TDAM_Top_down_attention_module 。
引用
@article{arxiv.2111.13470,
title = {TDAM: Top-Down Attention Module for Contextually Guided Feature Selection in CNNs},
author = {Shantanu Jaiswal and Basura Fernando and Cheston Tan},
journal= {arXiv preprint arXiv:2111.13470},
year = {2022}
}
备注
ECCV 2022 Camera Ready