中文

利用卷积神经网络学习场景要点以提升目标识别

计算机视觉与模式识别 2018-06-12 v2

摘要

卷积神经网络(CNNs)在多项目标识别任务上取得高性能方面已取得显著进展。尽管一些方法利用整个场景的信息来提议感兴趣区域,但对特定区域或目标的解读仍独立于图像中其他目标与特征进行。本文证明,场景的“要点(gist)”可显著有助于人类识别目标的能力。这些发现与如下观点一致:人类注视于某一目标并融合来自周边视野的信息以辅助识别。我们采用一种受生物学启发的双部件卷积神经网络(“GistNet”)来建模中央凹与周边视野,以此提供原理验证,表明计算式目标识别可显著受益于作为上下文信息的场景要点。我们的模型在引入上下文要点后,某些目标类别的准确率提升高达50%,而仅使原模型规模增加5%。该模型反映了我们关于人类视觉系统如何识别目标的直觉,为改进机器视觉提出了具体的生物学合理约束,并为场景理解这一挑战性任务构建了初步步骤。

关键词

引用

@article{arxiv.1803.01967,
  title  = {Learning Scene Gist with Convolutional Neural Networks to Improve Object Recognition},
  author = {Kevin Wu and Eric Wu and Gabriel Kreiman},
  journal= {arXiv preprint arXiv:1803.01967},
  year   = {2018}
}