用于细粒度分类的注意力机制
计算机视觉与模式识别
2015-04-14 v3 机器学习
神经与进化计算
摘要
本文展示了扩展 Ba 等人 (2014) 关于注意力循环神经模型工作的实验,将其应用于约束较少的视觉环境,具体为 Stanford Dogs 数据集上的细粒度分类。在本工作中,我们使用了相同结构的 RNN,但替换为更强大的视觉网络,并在注意力 RNN 之外对视觉网络进行了大规模预训练。迄今为止,大多数注意力模型工作集中于玩具任务或约束较多的视觉环境,而我们的细粒度分类结果优于最先进的 GoogLeNet 分类模型。我们表明,我们的模型学会了将高分辨率注意力导向最具判别力的区域,而无需任何空间监督(如边界框),并且即使仅给定初始低分辨率上下文图像以及对面部和毛发模式的狭窄、低成本 glimpses,它也能适度良好地区分细粒度犬种。与当前包含手工设计组件且信息会丢失的检测和识别流程相比,此类注意力模型的主要优势在于能够进行端到端训练。虽然我们的模型处于最先进水平,但仍需进一步工作以充分利用序列输入。
引用
@article{arxiv.1412.7054,
title = {Attention for Fine-Grained Categorization},
author = {Pierre Sermanet and Andrea Frome and Esteban Real},
journal= {arXiv preprint arXiv:1412.7054},
year = {2015}
}
备注
ICLR 2015 Workshop