中文

ZegCLIP:面向CLIP适配零样本语义分割

计算机视觉与模式识别 2023-06-21 v3

摘要

近来,CLIP已通过两阶段方案应用于像素级零样本学习任务。一般思路是先生成类无关的候选区域,再将裁剪后的候选区域送入CLIP以利用其图像级零样本分类能力。尽管有效,此类方案需要两个图像编码器,一个用于候选生成,一个用于CLIP,导致流程复杂且计算成本高。本工作中,我们追求一种更简单高效的单阶段方案,将CLIP的零样本预测能力直接从图像级扩展到像素级。我们的研究始于一个直扩基线,通过比较CLIP提取的文本与图像块嵌入间的相似度生成语义掩码。然而,该范式可能严重过拟合已见类,无法泛化到未见类。为处理此问题,我们提出三个简单而有效的设计,并发现它们能显著保留CLIP固有的零样本能力并提升像素级泛化能力。整合这些改进得到了一个高效的零样本语义分割系统ZegCLIP。在三个公开基准上的大量实验表明,ZegCLIP在“归纳式”与“转导式”零样本设定下均以大幅优势优于SOTA方法。此外,相比两阶段方法,我们的单阶段ZegCLIP在推理时实现了约5倍加速。代码发布于https://github.com/ZiqinZhou66/ZegCLIP.git。

关键词

引用

@article{arxiv.2212.03588,
  title  = {ZegCLIP: Towards Adapting CLIP for Zero-shot Semantic Segmentation},
  author = {Ziqin Zhou and Bowen Zhang and Yinjie Lei and Lingqiao Liu and Yifan Liu},
  journal= {arXiv preprint arXiv:2212.03588},
  year   = {2023}
}

备注

12 pages, 8 figures