中文

CLIP 亦是良师:一种用于归纳式零样本语义分割的新学习框架

计算机视觉与模式识别 2024-02-22 v2

摘要

广义零样本语义分割旨在仅于可见类别监督下分割可见与不可见类别。为此,现有方法采用获得出色零样本性能的大规模视觉语言模型 (VLMs)。然而,由于 VLMs 为分类任务设计,直接适配 VLMs 可能导致次优性能。因此,我们提出 CLIP-ZSS(零样本语义分割),一个简单而有效的训练框架,使任何为闭集分割设计的图像编码器可在测试时应用于零样本与开放词汇任务,而无需与 VLMs 结合或插入新模块。CLIP-ZSS 包含两个关键模块:全局学习模块 (GLM) 与像素学习模块 (PLM)。GLM 通过拉近同图的图像编码器 CLS token 与稠密特征、推远异图特征,从 CLIP 视觉编码器探查知识。此外,为增强判别不可见类别的能力,设计了由伪标签与权重生成构成的 PLM。为生成语义可判别的伪标签,提出一种作用于稠密 token 的带掩码融合的多尺度 K-Means。在伪权重生成中,引入为未标注区域生成伪语义特征的合成器。在三个基准上的实验显示相较 SOTA 方法的巨大性能提升。

关键词

引用

@article{arxiv.2310.02296,
  title  = {CLIP Is Also a Good Teacher: A New Learning Framework for Inductive Zero-shot Semantic Segmentation},
  author = {Jialei Chen and Daisuke Deguchi and Chenkai Zhang and Xu Zheng and Hiroshi Murase},
  journal= {arXiv preprint arXiv:2310.02296},
  year   = {2024}
}