中文

基于结构对齐 SAM-DINO 的开放词汇分割方法 OVS-DINO

计算机视觉与模式识别 2026-04-10 v1 人工智能

摘要

开放词汇分割 (Open-Vocabulary Segmentation, OVS) 旨在通过利用语义描述将图像区域分割超出预定义类别集合的限制。虽然基于 CLIP 的方法在语义泛化方面表现突出,但经常缺乏实现稠密预测所需的细粒度空间感知。最近的研究尝试引入视觉基础模型 (Vision Foundation Models, VFM) 如 DINO 以缓解这些限制。然而,这些方法仍在实现高保真分割所必需的精确边缘感知方面困难。本文分析了 DINO 的内部表示,发现其固有的边界感知并非缺失,而是在特征过渡到更深的变换器块时呈现渐进衰减。为此,我们提出了 OVS-DINO,一种通过与 Segment Anything Model (SAM) 结构对齐来唤醒 DINO 潜在边缘灵敏性的新框架。具体而言,我们引入结构感知编码器 (Structure-Aware Encoder, SAE) 和结构调制解码器 (Structure-Modulated Decoder, SMD),以 SAM 的结构先验有效激活 DINO 的边界特征,并辅以利用 SAM 生成的伪掩码的监督策略。大量实验表明,我们的方法在多个弱监督 OVS 基准中实现了最先进的性能,将平均得分提升 2.1%(从 44.8% 提升至 46.9%)。值得注意的是,我们的方法在复杂混乱场景中显著提升了分割精度,在 Cityscapes 上的提升达 6.3%(从 36.6% 提升至 42.9%)。

关键词

引用

@article{arxiv.2604.08461,
  title  = {OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance},
  author = {Haoxi Zeng and Qiankun Liu and Yi Bin and Haiyue Zhang and Yujuan Ding and Guoqing Wang and Deqiang Ouyang and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2604.08461},
  year   = {2026}
}

备注

14 pages, 12 figures, 5 tables