WegFormer:用于弱监督语义分割的Transformer模型
计算机视觉与模式识别
2022-03-17 v1
摘要
尽管卷积神经网络(CNNs)在弱监督语义分割(WSSS)中取得了显著进展,但CNN的有效感受野不足以捕捉全局上下文信息,导致次优结果。受Transformer在基础视觉领域巨大成功的启发,本工作首次引入Transformer构建简单而有效的WSSS框架,称为WegFormer。与现有基于CNN的方法不同,WegFormer使用Vision Transformer (ViT)作为分类器来生成高质量伪分割掩码。为此,我们在基于Transformer的框架中引入了三个定制组件,即(1)用于生成注意力图的Deep Taylor Decomposition (DTD),(2)用于平滑注意力图的软擦除模块,以及(3)用于过滤背景中噪声激活的高效潜在目标挖掘(EPOM)。无需任何额外技巧,WegFormer在PASCAL VOC数据集上取得了70.5% mIoU的当前最佳性能,显著优于先前最佳方法。我们希望WegFormer为挖掘Transformer在弱监督语义分割中的潜力提供新视角。代码将公开。
引用
@article{arxiv.2203.08421,
title = {WegFormer: Transformers for Weakly Supervised Semantic Segmentation},
author = {Chunmeng Liu and Enze Xie and Wenjia Wang and Wenhai Wang and Guangyao Li and Ping Luo},
journal= {arXiv preprint arXiv:2203.08421},
year = {2022}
}
备注
Tech Report