用于多目标识别的增强型深度循环视觉注意力模型
计算机视觉与模式识别
2017-06-13 v1 机器学习
摘要
我们设计了一种增强型深度循环视觉注意力模型(EDRAM)——一种用于多目标识别的改进的基于注意力的架构。所提模型是一个完全可微的单元,可使用随机梯度下降(SGD)进行端到端优化。采用空间变换器(Spatial Transformer, ST)作为视觉注意力机制,以学习图像中物体的几何变换。结合空间变换器与强大的循环架构,所提 EDRAM 可同时定位与识别物体。EDRAM 已在两个公开数据集上评估,包括 MNIST Cluttered(含 70K 个杂乱数字)和 SVHN(含多达 250k 个真实世界门牌号图像)。实验表明,其相比最先进模型具有更优性能。
引用
@article{arxiv.1706.03581,
title = {Enriched Deep Recurrent Visual Attention Model for Multiple Object Recognition},
author = {Artsiom Ablavatski and Shijian Lu and Jianfei Cai},
journal= {arXiv preprint arXiv:1706.03581},
year = {2017}
}