可迁移的半监督语义分割
计算机视觉与模式识别
2018-05-10 v2
摘要
基于深度学习的语义分割模型的性能严重依赖于带有精细标注的充足数据。然而,即便是最大的公共数据集也仅为相当有限的语义类别提供带有像素级标注的样本。这种数据稀缺性严重限制了语义分割模型在真实应用中的可扩展性与适用性。本文提出一种新颖的可迁移半监督语义分割模型,该模型能够将已学习的分割知识从少量带有像素级标注的强类别迁移到仅含图像级标注的未知弱类别,从而显著拓宽深度分割模型的适用领域。具体而言,所提模型由两个互补且可学习的组件构成:标签迁移网络(L-Net)与预测迁移网络(P-Net)。L-Net 通过学习跨类别共享的相似外观,将分割知识从强类别迁移到弱类别图像中并生成粗粒度像素级语义图。与此同时,P-Net 通过精心设计的对抗学习策略对迁移知识进行裁剪,生成具有更佳细节的精细化分割结果。在 PASCAL VOC 2012 上,集成 L-Net 与 P-Net 分别仅使用 50% 和 0% 带有像素级标注的类别即达到了全监督基线 96.5% 和 89.4% 的性能。借助这一新颖的迁移机制,我们所提模型易于泛化至多种新类别,仅需图像级标注,并在真实应用中具有良好的可扩展性。
引用
@article{arxiv.1711.06828,
title = {Transferable Semi-supervised Semantic Segmentation},
author = {Huaxin Xiao and Yunchao Wei and Yu Liu and Maojun Zhang and Jiashi Feng},
journal= {arXiv preprint arXiv:1711.06828},
year = {2018}
}
备注
Minor update of arXiv:1711.06828