中文

基于自上而下视觉注意的动作驱动目标检测

计算机视觉与模式识别 2016-12-21 v1 人工智能 机器学习

摘要

基于深度学习的目标检测的一个主导范式依赖于使用类别无关候选区域的“被动”评分的“自下而上”方法。这些方法效率高,但缺乏对场景级上下文的整体分析。在本文中,我们使用我们的“自上而下”视觉注意模型提出了一种“动作驱动”的检测机制。我们通过采取注意模型提供的顺序动作来定位目标。以图像区域为条件的注意模型提供接近目标对象所需的动作。每个时间步的动作本身是弱的,但顺序动作的集合使边界框准确地收敛到目标对象边界。这个我们称为 AttentionNet 的注意模型由一个卷积神经网络组成。在我们的整个检测过程中,我们仅利用来自单个 AttentionNet 的动作,无需任何目标候选区域模块或后边界框回归。我们在 PASCAL VOC 系列和 ILSVRC CLS-LOC 数据集上评估了我们的自上而下检测机制,与主要的自下而上检测方法相比,达到了最先进的性能。特别是,当我们将正检测的 IoU 阈值提高到 0.7 时,我们的检测机制在精细定位方面显示出强大优势,在 PASCAL VOC 2007 上以 +7.1% 的优势超越了 Faster R-CNN。

关键词

引用

@article{arxiv.1612.06704,
  title  = {Action-Driven Object Detection with Top-Down Visual Attentions},
  author = {Donggeun Yoo and Sunggyun Park and Kyunghyun Paeng and Joon-Young Lee and In So Kweon},
  journal= {arXiv preprint arXiv:1612.06704},
  year   = {2016}
}