中文

部分 CLIP 就足够:Chimera-Seg 实现零样本语义分割

计算机视觉与模式识别 2025-06-30 v1

摘要

零样本语义分割 (ZSS) 旨在仅使用 seen 类 supervision 来分割 seen 和 unseen 类。除了基于适应的方法外,提炼方法将视觉语言模型(如 CLIP)的视觉语言对齐知识传递给分割模型。然而,这种知识传递面临两个挑战:(1) 将基于视觉的特征与文本空间对齐需要结合空间精度与视觉语言对齐;(2) CLIP 的全局表示与分割模型的局部、细粒度特征之间的语义差距。为解决挑战 (1),我们提出 Chimera-Seg,将分割主干作为身体、CLIP 语义头部作为头部,如希腊神话中的奇米拉亚,结合空间精度与视觉语言对齐。具体而言,Chimera-Seg 包含一个可训练的分割模型和 CLIP 语义头部 (CSH),后者将稠密特征映射到 CLIP 对齐空间中。CSH 包含来自 CLIP 视觉编码器的冻结子网络和固定投影层,以及轻量级可训练组件。来自 CLIP 视觉编码器的部分模块,配合分割模型,保留分割能力,同时减轻对 CLIP 语义空间的映射。为解决挑战 (2),我们提出选择性全局提炼 (SGD),从稠密特征中提炼与 CLIP CLS token 高度相似的特征,训练过程中逐渐减少用于对齐的特征数量。此外,我们还使用语义对齐模块 (SAM) 进一步对齐稠密视觉特征与从冻结 CLIP 文本编码器中提取的语义嵌入。在两个基准测试上进行实验,hIoU 提升了 0.9% 和 1.2%。

关键词

引用

@article{arxiv.2506.22032,
  title  = {Partial CLIP is Enough: Chimera-Seg for Zero-shot Semantic Segmentation},
  author = {Jialei Chen and Xu Zheng and Danda Pani Paudel and Luc Van Gool and Hiroshi Murase and Daisuke Deguchi},
  journal= {arXiv preprint arXiv:2506.22032},
  year   = {2025}
}