中文

用于多标签图像识别的循环注意力强化学习

计算机视觉与模式识别 2017-12-21 v1

摘要

识别图像的多重标签是计算机视觉中一项基础而具挑战性的任务,通过定位语义感知的图像区域并用深度卷积神经网络预测其标签已取得显著进展。然而,这些现有多标签图像识别流程中的假设区域(候选区域)定位步骤通常带来冗余计算开销,例如生成数百个带有非判别性信息的无意义候选区域并提取其特征,且被定位区域间的空间上下文依赖建模常被忽略或过度简化。为解决这些问题,本文提出一种循环注意力强化学习框架,迭代地发现一系列与不同语义对象相关的注意力信息区域,并进一步以这些区域为条件预测标签分数。此外,我们的方法显式建模这些注意力区域间的长期依赖,有助于捕捉语义标签共现从而便利多标签识别。在两个大规模基准(即PASCAL VOC与MS-COCO)上的大量实验与对比表明,我们的模型在性能与效率上均优于现有最先进(SOTA)方法,并能将图像级语义标签显式对应到特定对象区域。

关键词

引用

@article{arxiv.1712.07465,
  title  = {Recurrent Attentional Reinforcement Learning for Multi-label Image Recognition},
  author = {Tianshui Chen and Zhouxia Wang and Guanbin Li and Liang Lin},
  journal= {arXiv preprint arXiv:1712.07465},
  year   = {2017}
}

备注

Accepted at AAAI 2018