中文

DCP-CLIP:面向开放词汇语义分割的粗到细框架

计算机视觉与模式识别 2026-03-17 v1

摘要

近年来,随着视觉-语言基础模型在开放词汇语义分割 (OVSS) 中的显著发展,仍面临以下根本性挑战:(1) 文本与视觉空间之间跨模态通信不足,(2) 与大量类别进行交互的计算成本显著。为此,本文描述了一种新颖的粗到细框架,称为 DCP-CLIP,用于 OVSS。不同于以往主要依赖预建立的类别内容和 CLIP 内在的空间-类别交互能力的做法,我们动态构建与类别相关的文本特征,并显式地建模空间图像特征与文本类语义之间的双向交互。具体而言,我们首先利用 CLIP 的开放词汇识别能力识别与图像上下文相关的语义类别,基于此动态生成相应的文本特征作为初始文本指导。随后,我们通过将文本指导中的语义信息跨模态整合到视觉表示中实现粗糙分割,并通过整合编码器中从编码器获得的空间丰富特征来恢复细粒度细节并增强空间分辨率。在最后,我们利用分段侧的空间信息来细化每个掩码的类别预测,促进更精确的语义标记。在多个 OVSS 基准测试上实验表明,DCP-CLIP 在提供更高准确率和更高效率方面优于现有方法。

关键词

引用

@article{arxiv.2603.13951,
  title  = {DCP-CLIP:A Coarse-to-Fine Framework for Open-Vocabulary Semantic Segmentation with Dual Interaction},
  author = {Jing Wang and Huimin Shi and Quan Zhou and Qibo Liu and Suofei Zhang and Huimin Lu},
  journal= {arXiv preprint arXiv:2603.13951},
  year   = {2026}
}

备注

13 pages, 7 figures