用于场景解析的循环卷积神经网络
计算机视觉与模式识别
2013-06-13 v1
摘要
场景解析是一种根据像素所属类别为图像中所有像素赋予标签的技术。为确保良好的视觉连贯性和高类别准确率,场景解析器必须捕捉图像的长程依赖关系。在前馈架构中,这可以通过在待标记的每个像素周围考虑足够大的输入上下文块来简单实现。我们提出了一种由循环卷积神经网络组成的方法,该方法允许我们考虑较大的输入上下文,同时限制模型容量。与大多数标准方法不同,我们的方法不依赖任何分割方法或特定任务特征。系统在原始像素上以端到端方式进行训练,并以低推理成本建模复杂的空间依赖关系。随着内置循环机制使上下文尺寸增加,系统能够识别并纠正其自身的错误。我们的方法在 Stanford Background Dataset 和 SIFT Flow Dataset 上均取得了最先进(SOTA)的性能,同时在测试时保持极高的速度。
引用
@article{arxiv.1306.2795,
title = {Recurrent Convolutional Neural Networks for Scene Parsing},
author = {Pedro H. O. Pinheiro and Ronan Collobert},
journal= {arXiv preprint arXiv:1306.2795},
year = {2013}
}