用于语义图像分割的带空洞可分离卷积编解码器
计算机视觉与模式识别
2018-08-24 v3
摘要
空间金字塔池化模块或编解码器结构被用于语义分割任务的深度神经网络中。前者网络能够通过以多种速率和多个有效视场对输入特征进行滤波或池化操作来编码多尺度上下文信息,而后者网络可通过逐步恢复空间信息来捕获更清晰的目标边界。本工作中,我们提议结合两种方法的优势。具体而言,我们提出的模型 DeepLabv3+ 通过添加一个简单而有效的解码器模块来扩展 DeepLabv3,以细化分割结果,尤其在目标边界处。我们进一步探索 Xception 模型,并将深度可分离卷积应用于空洞空间金字塔池化与解码器模块,从而得到一个更快且更强的编解码网络。我们在 PASCAL VOC 2012 与 Cityscapes 数据集上展示了所提模型的有效性,在无任何后处理的情况下取得 89.0\% 与 82.1\% 的测试集性能。我们的论文附带了所提模型在 Tensorflow 中的公开可用参考实现,见 \url{https://github.com/tensorflow/models/tree/master/research/deeplab}。
引用
@article{arxiv.1802.02611,
title = {Encoder-Decoder with Atrous Separable Convolution for Semantic Image Segmentation},
author = {Liang-Chieh Chen and Yukun Zhu and George Papandreou and Florian Schroff and Hartwig Adam},
journal= {arXiv preprint arXiv:1802.02611},
year = {2018}
}
备注
ECCV 2018 camera ready