利用Swin Transformer实现从局部到全局的弱监督语义分割
计算机视觉与模式识别
2024-03-12 v2 人工智能
摘要
近年来,使用图像级标签作为监督的弱监督语义分割在计算机视觉领域受到了广泛关注。大多数现有方法通过专注于从类激活图(CAM)生成伪标签来促进监督学习,从而解决了这些标签缺乏空间信息所带来的挑战。由于CNN的局部模式检测特性,CAM通常只强调目标最具判别力的部分,这使得准确区分前景目标彼此以及背景变得困难。最近的研究表明,Vision Transformer(ViT)特征由于其全局视野,在捕捉场景布局方面比CNN更有效。然而,分层ViT的使用在该领域尚未得到广泛探索。本文通过提出“SWTformer”来探索Swin Transformer的使用,通过结合局部和全局视图来提高初始种子CAM的准确性。SWTformer-V1仅使用补丁标记作为特征来生成类别概率和CAM。SWTformer-V2结合了多尺度特征融合机制以提取额外信息,并利用背景感知机制生成具有改进的跨目标判别能力的更准确的定位图。基于在PascalVOC 2012数据集上的实验,SWTformer-V1的定位精度提高了0.98% mAP,优于最先进的模型。在仅依赖分类网络生成初始定位图时,其平均性能也比其他方法高出0.82% mIoU。SWTformer-V2进一步将生成的种子CAM的精度提高了5.32% mIoU,进一步证明了Swin Transformer提供的局部到全局视图的有效性。代码见:https://github.com/RozhanAhmadi/SWTformer
引用
@article{arxiv.2401.17828,
title = {Leveraging Swin Transformer for Local-to-Global Weakly Supervised Semantic Segmentation},
author = {Rozhan Ahmadi and Shohreh Kasaei},
journal= {arXiv preprint arXiv:2401.17828},
year = {2024}
}
备注
7 pages, 4 figures, 3 tables