探索用于弱监督语义分割的像素级自监督
计算机视觉与模式识别
2021-12-13 v1
摘要
弱监督语义分割(WSSS)的现有研究利用类激活图(CAMs)来定位类对象。然而,由于分类损失不足以提供精确的对象区域,CAMs 往往偏向判别性模式(即稀疏性)且不能提供精确的对象边界信息(即不精确性)。为解决这些局限,我们提出了一种新颖框架(由 MainNet 和 SupportNet 组成),从给定的图像级监督中导出像素级自监督。在我们的框架中,在提出的区域对比模块(RCM)和多尺度注意力模块(MAM)的帮助下,MainNet 通过来自 SupportNet 的自监督进行训练。RCM 从 SupportNet 提取两种形式的自监督:(1)由 CAMs 生成的类区域掩码,和(2)根据类区域掩码从特征获得的类原型。然后,MainNet 的每个像素级特征以对比方式由原型训练,使所得 CAMs 更锐利。MAM 利用从 SupportNet 推断的多尺度 CAMs 作为自监督来引导 MainNet。基于 MainNet 与 SupportNet 多尺度 CAMs 之间的差异,MainNet 的 CAMs 被训练以扩展到较少判别性区域。所提方法在 PASCAL VOC 2012 数据集上的训练集和验证集均展示了最先进的 WSSS 性能。为可复现性,代码将很快公开。
引用
@article{arxiv.2112.05351,
title = {Exploring Pixel-level Self-supervision for Weakly Supervised Semantic Segmentation},
author = {Sung-Hoon Yoon and Hyeokjun Kweon and Jaeseok Jeong and Hyeonseong Kim and Shinjeong Kim and Kuk-Jin Yoon},
journal= {arXiv preprint arXiv:2112.05351},
year = {2021}
}