DPSeg:面向开放词汇语义分割的双提示代价体学习
计算机视觉与模式识别
2025-05-20 v1
摘要
开放词汇语义分割旨在像素级别将图像分割为不同的语义区域,同时涵盖已见和未见类别。当前方法利用来自预训练视觉-语言模型(如 CLIP)的文本嵌入,但即使在训练期间进行了大量对齐,仍然难以克服图像与文本嵌入之间固有的领域差距。此外,仅依赖深层文本对齐特征会限制浅层特征引导,而这对检测小物体和精细细节至关重要,最终会降低分割精度。为了解决这些局限性,我们为此任务提出了一个双提示框架 DPSeg。我们的方法结合了双提示代价体生成、代价体引导的解码器以及语义引导的提示优化策略,该策略利用我们的双提示方案来缓解视觉提示生成中的对齐问题。通过引入来自视觉提示编码器的视觉嵌入,我们的方法减少了文本与图像嵌入之间的领域差距,同时通过浅层特征提供多级引导。大量实验表明,我们的方法在多个公共数据集上显著优于现有的最先进方法。
引用
@article{arxiv.2505.11676,
title = {DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation},
author = {Ziyu Zhao and Xiaoguang Li and Linjia Shi and Nasrin Imanpour and Song Wang},
journal= {arXiv preprint arXiv:2505.11676},
year = {2025}
}
备注
Accepted by CVPR2025