中文

学习关注什么与在哪里关注

计算机视觉与模式识别 2019-06-12 v4

摘要

视觉识别领域近期的多数进展源于在深度卷积网络(DCNs)中引入注意力机制。由于这些网络针对物体识别进行优化,它们仅利用由图像类别标签派生出的弱监督形式来学习在哪里关注。在此,我们展示了使用更强监督信号的好处:教导 DCNs 关注人类认为对物体识别重要的图像区域。我们首先描述了一个大规模在线实验(ClickMe),用于为 ImageNet 补充近五十万张人类派生的“自顶向下”注意力图。通过人类心理物理学,我们确认 ClickMe 中识别出的自顶向下特征比“自底向上”显著性特征对快速图像分类更具诊断性。作为概念验证,我们扩展了一个最先进的注意力网络,并证明加入 ClickMe 监督显著提升了其准确率,且产生的视觉特征更具可解释性,并与人类观察者所使用的特征更为相似。

关键词

引用

@article{arxiv.1805.08819,
  title  = {Learning what and where to attend},
  author = {Drew Linsley and Dan Shiebler and Sven Eberhardt and Thomas Serre},
  journal= {arXiv preprint arXiv:1805.08819},
  year   = {2019}
}

备注

Previously called Global-and-local attention networks for visual recognition. Current version published in ICLR 2019: https://openreview.net/forum?id=BJgLg3R9KQ