中文

MCTformer+:用于弱监督语义分割的多类令牌Transformer

计算机视觉与模式识别 2023-08-08 v1

摘要

本文提出一种新颖的基于Transformer的框架,旨在通过生成准确的类特定目标定位图作为伪标签来增强弱监督语义分割(WSSS)。基于标准视觉Transformer中单类令牌的关注区域有助于类不可知定位图的观察,我们探索了Transformer模型通过学习多个类令牌来捕获类特定注意力以实现类判别目标定位的潜力。我们引入多类令牌Transformer,其融合多个类令牌以实现与图像块令牌的类感知交互。为此,我们设计了一种类感知训练策略,在输出类令牌与真实类标签之间建立一一对应。此外,提出对比类令牌(CCT)模块以增强判别性类令牌的学习,使模型更好地捕获每类的独特特征与属性。结果,通过利用与不同类令牌关联的类到块注意力,可有效生成类判别目标定位图。为进一步精炼这些定位图,我们提出利用从块到块Transformer注意力导出的块级成对亲和性。此外,所提框架无缝补充类激活映射(CAM)方法,在PASCAL VOC 2012与MS COCO 2014数据集上显著提升了WSSS性能。这些结果凸显了类令牌对WSSS的重要性。

关键词

引用

@article{arxiv.2308.03005,
  title  = {MCTformer+: Multi-Class Token Transformer for Weakly Supervised Semantic Segmentation},
  author = {Lian Xu and Mohammed Bennamoun and Farid Boussaid and Hamid Laga and Wanli Ouyang and Dan Xu},
  journal= {arXiv preprint arXiv:2308.03005},
  year   = {2023}
}

备注

Journal extension for MCTformer