中文

$A^2$-Nets:双重注意力网络

计算机视觉与模式识别 2018-10-30 v1

摘要

学习捕捉长程关系对于图像/视频识别至关重要。现有的 CNN 模型通常依赖增加深度来建模此类关系,效率极低。在本工作中,我们提出“双重注意力块”这一新颖组件,它从输入图像/视频的整个时空空间中聚合并传播有信息的全局特征,使后续的卷积层能够高效访问来自整个空间的特征。该组件采用两步双重注意力机制设计:第一步通过二阶注意力池化从整个空间收集特征至一个紧凑集合,第二步通过另一注意力自适应地选择特征并分发至每个位置。所提出的双重注意力块易于采用,可方便地插入现有深度神经网络。我们在图像与视频识别任务上进行了大量消融研究与实验以评估其性能。在图像识别任务上,装备了我们双重注意力块的 ResNet-50 在 ImageNet-1k 数据集上以少于 40% 的参数数量和更少 FLOPs 优于大得多的 ResNet-152 架构。在动作识别任务上,我们提出的模型在 Kinetics 和 UCF-101 数据集上以显著高于近期工作的效率取得了最先进(state-of-the-art)结果。

关键词

引用

@article{arxiv.1810.11579,
  title  = {$A^2$-Nets: Double Attention Networks},
  author = {Yunpeng Chen and Yannis Kalantidis and Jianshu Li and Shuicheng Yan and Jiashi Feng},
  journal= {arXiv preprint arXiv:1810.11579},
  year   = {2018}
}

备注

Accepted at NIPS 2018