中文

SSR:基于CLIP的弱监督分割中的语义与空间校正

计算机视觉与模式识别 2025-12-23 v2

摘要

近年来,基于对比语言-图像预训练(CLIP)的强大的跨模态语义理解能力,使其广泛应用于弱监督语义分割(WSSS)任务。本文提出一种新颖的语义与空间校正(SSR)方法,以解决现有CLIP-based弱监督语义分割方法的局限性:在非目标前景区域和背景区域过度激活。具体而言,在语义层面,跨模态原型对齐(CMPA)建立对比学习机制,以实现跨模态特征空间的对齐,减少类别间重叠同时增强语义相关性,从而有效校正非目标前景区域的过度激活;在空间层面,基于超像素的校正(SGC)利用超像素的空间先验,精确过滤掉非目标区域在亲和力传播中的干扰,显著校正背景的过度激活。大量实验表明,在PASCAL VOC和MS COCO数据集上,我们的方法优于所有单阶段方法以及更复杂的多阶段方法,分别实现了79.5%和50.6%的mIoU。

关键词

引用

@article{arxiv.2512.01701,
  title  = {SSR: Semantic and Spatial Rectification for CLIP-based Weakly Supervised Segmentation},
  author = {Xiuli Bi and Die Xiao and Junchao Fan and Bin Xiao},
  journal= {arXiv preprint arXiv:2512.01701},
  year   = {2025}
}

备注

Accepted in AAAI 2026