[CLS] 令牌即零样本语义分割所需的一切
计算机视觉与模式识别
2023-04-14 v1
摘要
在本文中,我们提出了一种极其简单却高度有效的零样本语义分割(ZS3)方法,该方法基于预训练的视觉-语言模型 CLIP。首先,我们的研究给出了若干关键发现:(i) CLIP 文本分支中的全局令牌(即 Transformer 中的 [CLS] 令牌)提供了强大的语义信息表示;(ii) 这些文本侧 [CLS] 令牌可被视为类别先验,以引导 CLIP 视觉编码器更多地关注相应的感兴趣区域。基于此,我们以 CLIP 模型为骨干网络,扩展出从文本到视觉分支的单向 [CLS] 令牌导航,从而实现零样本密集预测,称为 \textbf{ClsCLIP}。具体而言,我们使用文本分支输出的 [CLS] 令牌作为辅助语义提示,替换基于 ViT 的视觉编码器浅层中的 [CLS] 令牌。这种单向导航更早地嵌入了此类全局类别先验,从而提升了语义分割性能。此外,为了更好地分割 ZS3 中的微小物体,我们通过局部放大策略进一步增强 ClsCLIP,该策略采用区域提议预处理,得到了 ClsCLIP+。大量实验表明,我们提出的 ZS3 方法达到了 SOTA 性能,甚至可与那些少样本语义分割方法相媲美。
引用
@article{arxiv.2304.06212,
title = {[CLS] Token is All You Need for Zero-Shot Semantic Segmentation},
author = {Letian Wu and Wenyao Zhang and Tengping Jiang and Wankou Yang and Xin Jin and Wenjun Zeng},
journal= {arXiv preprint arXiv:2304.06212},
year = {2023}
}
备注
8 pages,6 figures