中文

谱提示调优:揭示零样本语义分割中的未见类别

计算机视觉与模式识别 2024-06-04 v2 计算与语言

摘要

近年来,CLIP 已在像素级零样本分割任务中找到实际应用。当前的研究格局以两阶段方法为主,但这些方法受限于流程复杂和计算成本高昂等问题。虽然现有的单阶段方法缓解了这些问题并引入了视觉提示训练(Visual Prompt Training, VPT)以维持 CLIP 的泛化能力,但它们在充分利用 CLIP 进行像素级未见类别界定和精确像素预测方面仍显不足。为了进一步激发 CLIP 的零样本密集预测能力,我们提出了 SPT-SEG,这是一种将 CLIP 的适应性从图像级提升到像素级的单阶段方法。具体而言,我们首先引入了谱提示调优(Spectral Prompt Tuning, SPT),将谱提示融入 CLIP 视觉编码器的浅层,以捕捉图像的结构细节,从而增强对未见类别的理解。随后,我们引入了谱引导解码器(Spectral Guided Decoder, SGD),利用高频和低频信息引导网络的空间注意力聚焦于更显著的分类特征,从而实现精确的像素级预测结果。在两个公共数据集上的大量实验表明,我们的方法优于最先进(SOTA)的方法,在所有类别上表现良好,尤其在处理未见类别方面表现出色。代码地址:https://github.com/clearxu/SPT。

关键词

引用

@article{arxiv.2312.12754,
  title  = {Spectral Prompt Tuning:Unveiling Unseen Classes for Zero-Shot Semantic Segmentation},
  author = {Wenhao Xu and Rongtao Xu and Changwei Wang and Shibiao Xu and Li Guo and Man Zhang and Xiaopeng Zhang},
  journal= {arXiv preprint arXiv:2312.12754},
  year   = {2024}
}

备注

AAAI2024 Accepted