探索CLIP稠密知识用于弱监督语义分割
计算机视觉与模式识别
2025-04-16 v1 计算与语言
机器学习
图像与视频处理
摘要
基于图像级标签实现像素级预测的弱监督语义分割(WSSS)旨在利用类别激活图(CAM)实现。最近,基于对比语言-图像预训练(CLIP)的WSSS方法被引入。然而,近期方法主要关注图像-文本对齐以生成CAM,而CLIP在patch-文本对齐方面的潜力尚未被充分探索。在本工作中,我们提出ExCEL,通过一种新颖的patch-文本对齐范式探索CLIP的稠密知识。具体而言,我们提出文本语义丰富(Text Semantic Enrichment, TSE)和视觉校准(Visual Calibration, VC)模块,以提高文本和视觉模态之间的稠密对齐。为使文本嵌入语义信息丰富,我们的TSE模块应用大语言模型(LLM)构建数据范围的知识库,并通过一种隐式属性 hunts 过程丰富文本表示。为从视觉特征中挖掘细粒度知识,我们的VC模块首先提出静态视觉校准(Static Visual Calibration, SVC),以非参数方式传递细粒度知识。随后进一步提出可学习视觉校准(Learnable Visual Calibration, LVC),动态地将冻结特征偏移到具有多样语义分布中。通过这些增强措施,ExCEL不仅保留了CLIP的训练-free优势,还在PASCAL VOC和MS COCO上以更低的训练成本显著超越其他当前SOTA方法。
引用
@article{arxiv.2503.20826,
title = {Exploring CLIP's Dense Knowledge for Weakly Supervised Semantic Segmentation},
author = {Zhiwei Yang and Yucong Meng and Kexue Fu and Feilong Tang and Shuo Wang and Zhijian Song},
journal= {arXiv preprint arXiv:2503.20826},
year = {2025}
}
备注
CVPR2025