全卷积网络用于语义分割
计算机视觉与模式识别
2016-05-23 v1
摘要
卷积网络是产生特征层次的强大视觉模型。我们展示卷积网络自身,端到端、像素到像素训练,改进了先前语义分割的最佳结果。我们的关键见解是构建“全卷积”网络,接受任意大小输入并产生相应大小输出,具有高效推理和学习。我们定义并详述全卷积网络的空间,解释其对空间密集预测任务的应用,并与先前模型联系。我们调整当代分类网络(AlexNet、VGG net 和 GoogLeNet)为全卷积网络,并通过微调将学得表示迁移到分割任务。然后我们定义跳跃架构,结合来自深层粗糙层的语义信息与来自浅层精细层的外观信息,产生准确详细分割。我们的全卷积网络在 PASCAL VOC(2012 上相对改进 30% 至 67.2% 平均 IU)、NYUDv2、SIFT Flow 和 PASCAL-Context 上实现改进分割,而典型图像推理只需十分之一秒。
引用
@article{arxiv.1605.06211,
title = {Fully Convolutional Networks for Semantic Segmentation},
author = {Evan Shelhamer and Jonathan Long and Trevor Darrell},
journal= {arXiv preprint arXiv:1605.06211},
year = {2016}
}
备注
to appear in PAMI (accepted May, 2016); journal edition of arXiv:1411.4038