中文

DeepLab:基于深度卷积网络、空洞卷积和全连接条件随机场的语义图像分割

计算机视觉与模式识别 2017-05-15 v2

摘要

在这项工作中,我们利用深度学习处理语义图像分割任务,并做出了三项主要贡献,实验证明这些贡献具有显著的实际价值。首先,我们强调带有上采样滤波器的卷积,即“空洞卷积”,是密集预测任务中的强大工具。空洞卷积使我们能够显式地控制深度卷积神经网络中计算特征响应的分辨率。它还使我们能够有效扩大滤波器的视野以纳入更大的上下文,而无需增加参数数量或计算量。其次,我们提出空洞空间金字塔池化(ASPP)以在多尺度下稳健地分割物体。ASPP 使用多种采样率和有效视野的滤波器探测传入的卷积特征层,从而在多尺度下捕获物体以及图像上下文。第三,我们通过结合深度卷积神经网络和概率图模型的方法来改善物体边界的定位。深度卷积神经网络中常用的最大池化和下采样组合实现了不变性,但牺牲了定位精度。我们通过将最终深度卷积神经网络层的响应与全连接条件随机场(CRF)相结合来克服这一问题,定性和定量结果均表明这提高了定位性能。我们提出的“DeepLab”系统在 PASCAL VOC-2012 语义图像分割任务中设立了新的最先进水平,在测试集上达到 79.7% 的 mIOU,并在其他三个数据集上推进了结果:PASCAL-Context、PASCAL-Person-Part 和 Cityscapes。我们的所有代码均已在线公开。

关键词

引用

@article{arxiv.1606.00915,
  title  = {DeepLab: Semantic Image Segmentation with Deep Convolutional Nets, Atrous Convolution, and Fully Connected CRFs},
  author = {Liang-Chieh Chen and George Papandreou and Iasonas Kokkinos and Kevin Murphy and Alan L. Yuille},
  journal= {arXiv preprint arXiv:1606.00915},
  year   = {2017}
}

备注

Accepted by TPAMI