DiCLIP:扩散模型增强 CLIP 的稠密知识以实现弱监督语义分割
计算机视觉与模式识别
2026-05-07 v1
摘要
基于图像级标签的弱监督语义分割(WSSS)通常依赖类激活图(CAM)实现像素级预测。最近,CLIP(Contrastive Language-Image Pre-training)被引入用于生成 WSSS 中的 CAM。然而,之前的 WSSS 方法仅利用 CLIP 的视觉-语言配对属性进行稠密定位,忽略其在视觉和文本两个模态上固有的稠密知识有限这一问题,导致 CAM 生成不够理想。本文提出了 DiCLIP,一种 novel WSSS 框架,利用生成式扩散模型增强 CLIP 在两个模态上的稠密知识。具体而言,提出了视觉相关性增强(VCE)和文本语义增强(TSA)模块,用于增强稠密预测。为提高视觉特征的空间感知能力,VCE 模块利用扩散模型可靠的空间一致性来缓解 CLIP 注意力中的过平滑问题。它设计了注意力聚类细化(ACR)模块可靠地从扩散模型中提取多样化的相关性图。这些相关性图作为 CLIP 自注意力的多样性偏置,递归地将其视觉特征推向更具判别性的稠密分布。为了增强文本嵌入的语义,TSA 模块认为单一文本模态不足以涵盖视觉类别的可变性。因此,我们利用扩散模型的生成能力维护一个动态的 key-value 缓存模型,将 CAM 生成从 patch-text 匹配机制转变为一种新的视觉知识检索范式。通过这些增强手段,DiCLIP 不仅在 PASCAL VOC 和 MS COCO 上超越了最先进的方法,还显著减少了训练成本。代码已公开发布于 https://github.com/zwyang6/DiCLIP。
关键词
引用
@article{arxiv.2605.04593,
title = {DiCLIP: Diffusion Model Enhances CLIP's Dense Knowledge for Weakly Supervised Semantic Segmentation},
author = {Zhiwei Yang and Pengfei Song and Yucong Meng and Kexue Fu and Shuo Wang and Zhijian Song},
journal= {arXiv preprint arXiv:2605.04593},
year = {2026}
}
备注
This work is accepted by IEEE Transactions on Image Processing