中文

面向弱监督语义分割的视觉原型学习:克服 CLIP 中的模态鸿沟

计算机视觉与模式识别 2024-12-30 v1 机器学习

摘要

将 Contrastive Language-Image Pre-training (CLIP) 应用于弱监督语义分割 (WSSS) 研究, 能发挥强大的跨模态语义理解能力. 现有方法尝试通过精细调整文本原型来增强图像与文本的对齐, 以促进语义匹配.然而, 鉴于文本与视觉空间之间的模态鸿沟, 这些方法使用的文本原型尚未与像素级视觉特征建立紧密对应关系.本文的理论分析表明, 模态鸿沟导致文本与区域特征错位, 且仅通过最小化 CLIP 中的对比损失无法充分缩小这一鸿沟.为缓解模态鸿沟的影响, 本文提出一种视觉原型学习 (VPL) 框架, 通过引入更具代表性的视觉原型.该框架的核心是利用文本原型在视觉空间中学习类别特定的视觉原型, 以捕获高质量的局部映射.此外, 本文提出了区域语义对比模块, 通过对区域嵌入与相应原型进行对比, 实现更全面且稳健的特征学习.实验结果表明, 我们提出的框架在两个基准数据集上实现了最先进的性能.

关键词

引用

@article{arxiv.2412.19650,
  title  = {Toward Modality Gap: Vision Prototype Learning for Weakly-supervised Semantic Segmentation with CLIP},
  author = {Zhongxing Xu and Feilong Tang and Zhe Chen and Yingxue Su and Zhiyi Zhao and Ge Zhang and Jionglong Su and Zongyuan Ge},
  journal= {arXiv preprint arXiv:2412.19650},
  year   = {2024}
}