中文

用于图像分类的空间注意力输出层

计算机视觉与模式识别 2020-04-17 v1

摘要

大多数用于图像分类的卷积神经网络(CNNs)使用全局平均池化(GAP)后接全连接(FC)层以输出logits。然而,这种空间聚合过程本质上限制了输出层对位置特定信息的利用,尽管该空间信息有益于分类。本文中,我们在现有卷积特征图之上提出一种新颖的空间输出层,以显式利用位置特定的输出信息。具体而言,给定空间特征图,我们通过在空间logits上采用注意力掩码,以空间注意力输出层(SAOL)替换先前的GAP-FC层。所提出的定位特定注意力在目标区域内选择性聚合空间logits,这不仅带来性能提升,也产生具空间可解释性的输出。此外,所提出的SAOL还允许充分利用位置特定的自监督与自蒸馏,以增强训练中的泛化能力。所提出的带自监督与自蒸馏的SAOL可轻松插入现有CNNs。在多个分类任务及代表性架构上的实验结果展现出SAOL在几乎相同计算代价下的一致性能提升。

关键词

引用

@article{arxiv.2004.07570,
  title  = {Spatially Attentive Output Layer for Image Classification},
  author = {Ildoo Kim and Woonhyuk Baek and Sungwoong Kim},
  journal= {arXiv preprint arXiv:2004.07570},
  year   = {2020}
}

备注

First two authors contributed equally. Accepted at CVPR 2020