中文

DPSeg:面向开放词汇语义分割的双提示代价体学习

计算机视觉与模式识别 2025-05-20 v1

摘要

开放词汇语义分割旨在像素级别将图像分割为不同的语义区域,同时涵盖已见和未见类别。当前方法利用来自预训练视觉-语言模型(如 CLIP)的文本嵌入,但即使在训练期间进行了大量对齐,仍然难以克服图像与文本嵌入之间固有的领域差距。此外,仅依赖深层文本对齐特征会限制浅层特征引导,而这对检测小物体和精细细节至关重要,最终会降低分割精度。为了解决这些局限性,我们为此任务提出了一个双提示框架 DPSeg。我们的方法结合了双提示代价体生成、代价体引导的解码器以及语义引导的提示优化策略,该策略利用我们的双提示方案来缓解视觉提示生成中的对齐问题。通过引入来自视觉提示编码器的视觉嵌入,我们的方法减少了文本与图像嵌入之间的领域差距,同时通过浅层特征提供多级引导。大量实验表明,我们的方法在多个公共数据集上显著优于现有的最先进方法。

关键词

引用

@article{arxiv.2505.11676,
  title  = {DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation},
  author = {Ziyu Zhao and Xiaoguang Li and Linjia Shi and Nasrin Imanpour and Song Wang},
  journal= {arXiv preprint arXiv:2505.11676},
  year   = {2025}
}

备注

Accepted by CVPR2025