中文

聚焦何处:用于细粒度视觉识别的深度注意力空间递归双线性网络

计算机视觉与模式识别 2017-09-19 v1

摘要

细粒度视觉识别通常依赖于对物体部件间细微差异的建模。然而,这些部件常常表现出剧烈的视觉变化,如遮挡、视角和空间变换,这使得检测变得困难。在本文中,我们提出了一种新颖的基于注意力的模型,以自动、选择性地、准确地聚焦于具有更高重要性、能抵抗外观变化的关键物体区域。给定一张图像,我们构建了两个不同的卷积神经网络 (CNN),其中两个 CNN 的输出通过双线性池化相关联,以同时聚焦于判别性区域并提取相关特征。为了捕捉具有视觉注意力的局部区域间的空间分布,我们引入了基于软注意力的空间长短期记忆单元 (LSTM),以在局部输入模式上实现空间递归且视觉选择性的处理。所有上述思想使我们的网络具备了以下新颖模型:双流 CNN 层、双线性池化层、带有位置注意力的空间递归层通过端到端的方式联合训练,以充当部件检测器和特征提取器,从而有注意力地定位和提取相关特征。我们展示了我们的网络在两个著名的视觉识别任务上的重要性:细粒度图像分类和行人重识别。

关键词

引用

@article{arxiv.1709.05769,
  title  = {Where to Focus: Deep Attention-based Spatially Recurrent Bilinear Networks for Fine-Grained Visual Recognition},
  author = {Lin Wu and Yang Wang},
  journal= {arXiv preprint arXiv:1709.05769},
  year   = {2017}
}

备注

8 pages