中文

视觉Transformer的最大池化在弱监督语义分割中调和类别与形状

计算机视觉与模式识别 2022-11-01 v1

摘要

弱监督语义分割(WSSS)研究在仅以图像类别标签作为监督的条件下,探索了许多方向来改进典型的“CNN + 类激活图(CAM)+ 细化”流程。尽管与全监督方法的差距已缩小,但在该框架内进一步减少差距似乎不太可能。另一方面,基于视觉Transformer(ViT)的WSSS方法尚未探索CAM的有效替代方案。ViT特征已被证明在自监督学习中保留场景布局和物体边界。为证实这些发现,我们证明Transformer在自监督方法中的优势被全局最大池化(GMP)进一步强化,GMP可利用块特征来协调像素标签概率与类别概率。本文提出一种不基于CAM的名为ViT-PCM(ViT块-类别映射)的新WSSS方法。所提出的端到端网络通过单一优化过程学习,获得细化形状和适当定位的分割掩码。我们的模型在基线伪掩码(BPM)上优于当前最优方法,在PascalVOC 2012 val集上达到 69.3%69.3\% mIoU。我们表明,尽管取得了高于所有其他方法的精度,我们的方法具有最少的参数量。总之,我们方法的定量与定性结果显示ViT-PCM是基于CNN-CAM架构的优良替代方案。

关键词

引用

@article{arxiv.2210.17400,
  title  = {Max Pooling with Vision Transformers reconciles class and shape in weakly supervised semantic segmentation},
  author = {Simone Rossetti and Damiano Zappia and Marta Sanzari and Marco Schaerf and Fiora Pirri},
  journal= {arXiv preprint arXiv:2210.17400},
  year   = {2022}
}

备注

28 pages, 9 images, ECCV 2022 conference