用于语义分割的上下文编码
计算机视觉与模式识别
2018-03-26 v1
摘要
近期的工作通过采用膨胀/空洞卷积、利用多尺度特征以及细化边界,在全卷积网络(FCN)框架下提升像素级标注的空间分辨率方面取得了显著进展。本文通过引入上下文编码模块来探索全局上下文信息在语义分割中的作用,该模块能够捕获场景的语义上下文并选择性地突出依赖于类别的特征图。所提出的上下文编码模块在 FCN 基础上仅增加极少的额外计算成本,便显著提升了语义分割结果。我们的方法在 PASCAL-Context 上取得了 51.7% mIoU 的新 SOTA 结果,在 PASCAL VOC 2012 上取得了 85.9% mIoU。我们的单一模型在 ADE20K 测试集上取得了 0.5567 的最终得分,超越了 2017 年 COCO-Place 挑战赛的冠军方案。此外,我们还探索了上下文编码模块如何提升相对浅层网络在 CIFAR-10 数据集上图像分类的特征表示能力。我们的 14 层网络实现了 3.45% 的错误率,与层数超过其 10 倍以上的 SOTA 方法相当。完整系统的源代码已公开。
引用
@article{arxiv.1803.08904,
title = {Context Encoding for Semantic Segmentation},
author = {Hang Zhang and Kristin Dana and Jianping Shi and Zhongyue Zhang and Xiaogang Wang and Ambrish Tyagi and Amit Agrawal},
journal= {arXiv preprint arXiv:1803.08904},
year = {2018}
}
备注
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2018