不止看一次——面向语义分割的核共享空洞卷积
计算机视觉与模式识别
2019-11-19 v4
摘要
最先进的语义分割方案通常借助多个并行分支上不同的感受野来处理不同尺寸的物体。然而,为各分支使用独立卷积核会削弱网络的泛化与表征能力,且参数量随分支数线性增长。为解决该问题,我们提出一种新颖网络结构,即核共享空洞卷积(KSAC),其中不同感受野的分支共享同一卷积核,即让单个核以不同感受野不止一次地观察输入特征图,以促进分支间通信并在网络内部进行特征增强。在基准 PASCAL VOC 2012 数据集上的实验表明,所提共享策略不仅能提升网络的泛化与表征能力,还可显著降低了模型复杂度。具体而言,在验证集上,与配备 MobileNetv2 骨干的 DeepLabV3+ 相比,参数量减少 33% 且 mIOU 提升 0.6%。当使用 Xception 作骨干时,mIOU 从 83.34% 提升至 85.96%,节省约 10M 参数。此外,不同于广泛使用的 ASPP 结构,我们提出的 KSAC 能够通过更大空洞率利用更宽上下文进一步提升 mIOU。最后,我们的 KSAC 在 PASCAL VOC 2012 测试集与 ADE20K 数据集上分别取得 88.1% 与 45.47% 的 mIOU。我们的完整代码将在 Github 上发布。
引用
@article{arxiv.1908.09443,
title = {See More Than Once -- Kernel-Sharing Atrous Convolution for Semantic Segmentation},
author = {Ye Huang and Qingqing Wang and Wenjing Jia and Xiangjian He},
journal= {arXiv preprint arXiv:1908.09443},
year = {2019}
}
备注
Results updated. We have received a very large number of emails ask for the code. Thanks for your interest. We will release the code once the paper is offically published as we have promised