用于细粒度物体分类的多样化视觉注意力网络
计算机视觉与模式识别
2018-02-27 v2
摘要
细粒度物体分类由于细微的类间差异和较大的类内变化而成为一项具有挑战性的任务。近来,视觉注意力模型已被应用于自动定位图像中的判别性区域,以更好地捕捉关键差异,并展现出有前景的性能。然而,由于未考虑注意力过程中的多样性,大多数现有注意力模型在分类细粒度物体时表现不佳。本文中,我们提出了一种多样化视觉注意力网络 (DVAN) 来解决细粒度物体分类问题,与无注意力模型相比,该网络显著减轻了学习定位判别性区域时对强监督信息的依赖。更重要的是,DVAN 明确追求注意力的多样性,能够最大限度地收集判别性信息。生成多个注意力画布以提取用于注意力的卷积特征。采用 LSTM 循环单元来学习注意力画布的专注度和判别力。所提出的 DVAN 能够从粗粒度到细粒度关注物体,并通过逐步组合来自图像不同位置和尺度的信息,构建用于分类的动态内部表示。在 CUB-2011、Stanford Dogs 和 Stanford Cars 数据集上进行的大量实验表明,所提出的多样化视觉注意力网络在不使用任何先验知识、用户交互或训练测试中的外部资源的情况下,取得了与最先进方法相比具有竞争力的性能。
引用
@article{arxiv.1606.08572,
title = {Diversified Visual Attention Networks for Fine-Grained Object Classification},
author = {Bo Zhao and Xiao Wu and Jiashi Feng and Qiang Peng and Shuicheng Yan},
journal= {arXiv preprint arXiv:1606.08572},
year = {2018}
}