中文

用于多目标识别的增强型深度循环视觉注意力模型

计算机视觉与模式识别 2017-06-13 v1 机器学习

摘要

我们设计了一种增强型深度循环视觉注意力模型(EDRAM)——一种用于多目标识别的改进的基于注意力的架构。所提模型是一个完全可微的单元,可使用随机梯度下降(SGD)进行端到端优化。采用空间变换器(Spatial Transformer, ST)作为视觉注意力机制,以学习图像中物体的几何变换。结合空间变换器与强大的循环架构,所提 EDRAM 可同时定位与识别物体。EDRAM 已在两个公开数据集上评估,包括 MNIST Cluttered(含 70K 个杂乱数字)和 SVHN(含多达 250k 个真实世界门牌号图像)。实验表明,其相比最先进模型具有更优性能。

关键词

引用

@article{arxiv.1706.03581,
  title  = {Enriched Deep Recurrent Visual Attention Model for Multiple Object Recognition},
  author = {Artsiom Ablavatski and Shijian Lu and Jianfei Cai},
  journal= {arXiv preprint arXiv:1706.03581},
  year   = {2017}
}