基础模型辅助的弱监督语义分割
计算机视觉与模式识别
2023-12-12 v2 人工智能
摘要
本工作旨在利用预训练的基础模型,如对比语言-图像预训练(CLIP)和分割一切模型(SAM),以使用图像级标签解决弱监督语义分割(WSSS)。为此,我们提出了一个基于 CLIP 和 SAM 的从粗到细的框架,用于生成高质量的分割种子。具体而言,我们构建了一个图像分类任务和一个种子分割任务,这两个任务由权重冻结的 CLIP 和两组可学习的任务特定提示共同执行。设计了一个基于 SAM 的播种(SAMS)模块,并将其应用于每个任务以生成粗或细的种子图。此外,我们设计了一个由图像级标签监督的多标签对比损失和一个由生成的粗种子图监督的 CAM 激活损失。这些损失用于学习提示,这是我们框架中唯一需要学习的部分。一旦提示学习完成,我们将每张图像连同学习到的分割特定提示输入 CLIP 和 SAMS 模块,以生成高质量的分割种子。这些种子作为伪标签,像其他两阶段 WSSS 方法一样训练现成的分割网络。实验表明,我们的方法在 PASCAL VOC 2012 上取得了 SOTA 性能,并在 MS COCO 2014 上取得了有竞争力的结果。代码可在 https://github.com/HAL-42/FMA-WSSS.git 获取。
引用
@article{arxiv.2312.03585,
title = {Foundation Model Assisted Weakly Supervised Semantic Segmentation},
author = {Xiaobo Yang and Xiaojin Gong},
journal= {arXiv preprint arXiv:2312.03585},
year = {2023}
}