中文

用于零样本语义分割的递归训练

计算机视觉与模式识别 2021-10-06 v1

摘要

通用语义分割依赖于主干 CNN 网络提取判别性特征,以将每个图像像素分类为“已见”对象类(即训练期间可用的对象类)或背景类。零样本语义分割是一项具有挑战性的任务,要求计算机视觉模型识别属于其从未见过对象类的图像像素。使通用语义分割模型能够将“未见”类的图像像素与背景分离仍然是一个开放挑战。一些近期模型通过为零样本设置微调语义分割模型的最终像素分类层来处理该问题,但由于缺乏监督而难以学习判别性特征。我们提出一种递归训练方案,利用伪特征表示监督语义分割模型在零样本设置下的再训练。为此,我们提出零样本最大均值差异 (ZS-MMD) 损失,该损失将像素分类层的高置信度输出作为伪特征表示,并将其反馈给生成器。通过在生成器端闭环,我们在再训练期间提供监督,进而帮助模型为“未见”类学习更具判别性的特征表示。我们表明,使用我们的递归训练和 ZS-MMD 损失,我们提出的模型在 Pascal-VOC 2012 数据集和 Pascal-Context 数据集上达到了最先进的性能。

关键词

引用

@article{arxiv.2103.00086,
  title  = {Recursive Training for Zero-Shot Semantic Segmentation},
  author = {Ce Wang and Moshiur Farazi and Nick Barnes},
  journal= {arXiv preprint arXiv:2103.00086},
  year   = {2021}
}