中文

结合视觉单词学习与混合池化的弱监督语义分割

计算机视觉与模式识别 2022-02-11 v1

摘要

具有图像级标签的弱监督语义分割 (WSSS) 方法通常训练分类网络以生成类激活图 (CAM) 作为初始粗略分割标签。然而,当前的 WSSS 方法表现仍远不能令人满意,因为其采用的 CAM 1) 通常仅关注部分具有判别性的目标区域,且 2) 通常包含无用的背景区域。这两个问题归因于在训练分类网络时仅有图像级监督和全局信息的聚合。在本工作中,我们提出了视觉单词学习模块和混合池化方法,并将它们结合到分类网络中以缓解上述问题。在视觉单词学习模块中,我们通过强制分类网络学习细粒度的视觉单词标签来应对第一个问题,从而可以发现更多的目标范围。具体而言,视觉单词是通过码本学习的,该码本可以通过两种提出的策略进行更新,即基于学习的策略和基于记忆库的策略。所提出的混合池化缓解了 CAM 的第二个缺陷,它结合了全局平均和局部判别信息,以同时确保目标完整性并减少背景区域。我们在 PASCAL VOC 2012 和 MS COCO 2014 数据集上评估了我们的方法。在没有任何额外显著性先验的情况下,我们的方法在 PASCAL VOC 数据集的 valvaltesttest 集上分别达到了 70.6% 和 70.7% 的 mIoU,在 MS COCO 数据集的 valval 集上达到了 36.2% 的 mIoU,显著超越了现有 SOTA WSSS 方法的性能。

关键词

引用

@article{arxiv.2202.04812,
  title  = {Weakly-Supervised Semantic Segmentation with Visual Words Learning and Hybrid Pooling},
  author = {Lixiang Ru and Bo Du and Yibing Zhan and Chen Wu},
  journal= {arXiv preprint arXiv:2202.04812},
  year   = {2022}
}

备注

Accepted to IJCV