中文

用于场景标注的带注意力模型的多层级上下文 RNN

计算机视觉与模式识别 2016-08-12 v2

摘要

图像中的上下文对于场景标注至关重要,而现有方法仅利用从图像块或像素的小周围区域生成的局部上下文,相比之下,长程和全局上下文信息被忽略了。为解决这一问题,本文提出了一种通过探索多层级上下文循环神经网络(ML-CRNNs)进行场景标注的新方法。具体而言,我们在结构化的循环神经网络(RNNs)中编码三种上下文线索,即局部上下文、全局上下文和图像主题上下文,以建模图像中的长程局部和全局依赖关系。通过这种方式,我们的方法能够从长程局部和整体视角“观察”图像,从而对图像标注做出更可靠的推断。此外,我们将所提出的上下文 RNN 集成到分层卷积神经网络(CNNs)中,并利用多层级的依赖关系提供丰富的空间和语义信息。而且,我们新颖地采用注意力模型来有效融合多个层级,并表明其优于平均池化或最大池化融合策略。大量实验表明,所提方法在 CamVid、SiftFlow 和 Stanford-background 数据集上取得了新的最先进(state-of-the-art)结果。

关键词

引用

@article{arxiv.1607.02537,
  title  = {Multi-level Contextual RNNs with Attention Model for Scene Labeling},
  author = {Heng Fan and Xue Mei and Danil Prokhorov and Haibin Ling},
  journal= {arXiv preprint arXiv:1607.02537},
  year   = {2016}
}

备注

8 pages, 8 figures