用于目标检测的注意力上下文
计算机视觉与模式识别
2016-03-25 v1
摘要
现代基于深度神经网络的物体检测方法通常使用候选提议的内部特征进行分类。然而,被认为对物体检测有价值的全局和局部周边上下文尚未被现有方法充分利用。在这项工作中,我们迈出一步以理解什么是提取和利用上下文信息从而在实践中促进物体检测的鲁棒做法。具体地,我们考虑以下两个问题:“如何识别用于检测某一物体的有用全局上下文?”以及“如何利用提议周围的局部上下文以更好地推断其内容?”。我们通过开发一种新颖的注意力上下文卷积神经网络(AC-CNN)基于物体检测模型,对这些问题的初步回答。AC-CNN有效将全局和局部上下文信息整合进基于区域的CNN(如Fast RCNN)检测模型,并提供更好的物体检测性能。它由一个基于注意力的全局上下文(AGC)子网络和一个多尺度局部上下文(MLC)子网络组成。为捕获全局上下文,AGC子网络通过多个堆叠的长短期记忆(LSTM)层,递归地为输入图像生成注意力图以突出有用的全局上下文位置。为捕获周边局部上下文,MLC子网络在多尺度上利用每个特定提议的内部和外部上下文信息。然后将全局和局部上下文融合以做出最终检测决策。在PASCAL VOC 2007和VOC 2012上的大量实验很好地证明了所提AC-CNN相较既定基线的优越性。特别地,AC-CNN在mAP上分别比流行的Fast-RCNN在VOC 2007和VOC 2012上高出2.0%和2.2%。
引用
@article{arxiv.1603.07415,
title = {Attentive Contexts for Object Detection},
author = {Jianan Li and Yunchao Wei and Xiaodan Liang and Jian Dong and Tingfa Xu and Jiashi Feng and Shuicheng Yan},
journal= {arXiv preprint arXiv:1603.07415},
year = {2016}
}