双层注意力模型在深度卷积神经网络细粒度图像分类中的应用
计算机视觉与模式识别
2014-11-25 v1
摘要
细粒度分类具有挑战性,因为类别仅能通过细微的局部差异进行区分。姿态、尺度或旋转的变化通常使问题更加困难。大多数细粒度分类系统遵循寻找前景物体或物体部件(where)以提取判别性特征(what)的流程。在本文中,我们提出利用深度神经网络将视觉注意力应用于细粒度分类任务。我们的流程整合了三种类型的注意力:提出候选补丁的自底向上注意力、选择与特定物体相关补丁的物体级自顶向下注意力,以及定位判别性部件的部件级自顶向下注意力。我们结合这些注意力训练领域特定的深度网络,进而改善“什么”和“哪里”两个方面。重要的是,我们避免了使用边界框或部件信息等昂贵的标注来实现端到端训练。弱监督约束使我们的工作更易于泛化。我们在 ILSVRC2012 数据集和 CUB200_2011 数据集的子集上验证了该方法的有效性。我们的流程带来了显著改进,并在最弱监督条件下取得了最佳准确率。其性能可与依赖额外标注的其他方法相媲美。
引用
@article{arxiv.1411.6447,
title = {The Application of Two-level Attention Models in Deep Convolutional Neural Network for Fine-grained Image Classification},
author = {Tianjun Xiao and Yichong Xu and Kuiyuan Yang and Jiaxing Zhang and Yuxin Peng and Zheng Zhang},
journal= {arXiv preprint arXiv:1411.6447},
year = {2014}
}