用于语义分割的全卷积网络
计算机视觉与模式识别
2015-03-10 v2
摘要
卷积网络是强大的视觉模型,能够生成特征层次结构。我们表明,卷积网络本身经过端到端、像素到像素的训练,在语义分割任务中超越了最先进水平 (state-of-the-art)。我们的核心见解是构建“全卷积”网络,该网络能够接受任意尺寸的输入并产生相应尺寸的输出,同时具备高效的推理和学习能力。我们定义并详述了全卷积网络的空间,解释了它们在空间密集预测任务中的应用,并探讨了其与先前模型的联系。我们将当代分类网络(AlexNet、VGG net 和 GoogLeNet)改编为全卷积网络,并通过微调将其学习到的表示迁移至分割任务。随后,我们定义了一种新颖的架构,将来自深层粗粒度层的语义信息与来自浅层细粒度层的外观信息相结合,以生成准确且详细的分割结果。我们的全卷积网络在 PASCAL VOC(2012 年数据集上平均 IU 相对提升 20% 达到 62.2%)、NYUDv2 和 SIFT Flow 上实现了最先进水平的分割,而对于典型图像的推理仅需三分之一秒。
引用
@article{arxiv.1411.4038,
title = {Fully Convolutional Networks for Semantic Segmentation},
author = {Jonathan Long and Evan Shelhamer and Trevor Darrell},
journal= {arXiv preprint arXiv:1411.4038},
year = {2015}
}
备注
to appear in CVPR (2015)