CLIP 也是高效分割器:一种文本驱动的弱监督语义分割方法
计算机视觉与模式识别
2023-03-24 v3 人工智能
摘要
基于图像级标签的弱监督语义分割(WSSS)是一项具有挑战性的任务。主流方法遵循多阶段框架,且训练成本高昂。在本文中,我们探索了对比语言-图像预训练模型(CLIP)在仅使用图像级标签且无需进一步训练的情况下定位不同类别的潜力。为了从 CLIP 中高效生成高质量的分割掩码,我们提出了一种名为 CLIP-ES 的新型 WSSS 框架。我们的框架通过针对 CLIP 的特殊设计改进了 WSSS 的所有三个阶段:1)我们将 softmax 函数引入 GradCAM,并利用 CLIP 的零样本能力来抑制由非目标类别和背景引起的混淆。同时,为了充分利用 CLIP,我们在 WSSS 设置下重新探索了文本输入,并定制了两种文本驱动策略:基于锐度的提示选择和同义词融合。2) 为了简化 CAM 细化阶段,我们基于 CLIP-ViTs 中固有的多头自注意力(MHSA)提出了一种实时类感知注意力亲和力(CAA)模块。3) 在使用 CLIP 生成的掩码训练最终分割模型时,我们引入了一种置信度引导损失(CGL)来关注高置信度区域。我们的 CLIP-ES 在 Pascal VOC 2012 和 MS COCO 2014 数据集上取得了 SOTA 性能,而伪掩码生成时间仅为先前方法的 10%。代码可在 https://github.com/linyq2117/CLIP-ES 获取。
引用
@article{arxiv.2212.09506,
title = {CLIP is Also an Efficient Segmenter: A Text-Driven Approach for Weakly Supervised Semantic Segmentation},
author = {Yuqi Lin and Minghao Chen and Wenxiao Wang and Boxi Wu and Ke Li and Binbin Lin and Haifeng Liu and Xiaofei He},
journal= {arXiv preprint arXiv:2212.09506},
year = {2023}
}
备注
13 pages, 8 figures