WeakTr:探索朴素视觉 Transformer 用于弱监督语义分割
计算机视觉与模式识别
2026-03-26 v3
摘要
Transformer 已在各类计算机视觉任务中取得极大成功,理解其工作机制十分重要。作为试金石,弱监督语义分割(WSSS)与类激活图(CAM)是分析视觉 Transformer(ViT)的有用任务。基于用 ImageNet 分类预训练的朴素 ViT,我们发现多层多头自注意力图可为弱监督语义分割与 CAM 生成提供丰富且多样的信息,例如 ViT 的不同注意力头聚焦于不同图像区域与物体类别。因此我们提出一种端到端估计注意力头重要性的新方法,其中自注意力图被自适应融合以得到倾向于包含更完整物体的高质量 CAM 结果。此外,我们提出一种基于 ViT 的梯度裁剪解码器,用于利用 CAM 结果高效且有效地在线重训练。进而,该梯度裁剪解码器能充分利用大规模预训练 ViT 中的知识并具备可扩展能力。所提出的基于朴素 Transformer 的弱监督学习方法(WeakTr)在标准基准上取得了优越的 WSSS 性能,即在 PASCAL VOC 2012 的 val 集上 mIoU 为 78.5%,在 COCO 2014 的 val 集上 mIoU 为 51.1%。源代码与检查点可在 https://github.com/hustvl/WeakTr 获取。
引用
@article{arxiv.2304.01184,
title = {WeakTr: Exploring Plain Vision Transformer for Weakly-supervised Semantic Segmentation},
author = {Lianghui Zhu and Yingyue Li and Jiemin Fang and Yan Liu and Hao Xin and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2304.01184},
year = {2026}
}
备注
Accepted by IEEE Transactions on Image Processing, TIP. Source code and checkpoints are available at https://github.com/hustvl/WeakTr