中文

dinov3.seg:基于DINOv3的开放词汇语义分割

计算机视觉与模式识别 2026-03-23 v1 人工智能

摘要

开放词汇语义分割(OVSS)分配来自文本定义类别的开放集合中像素级标签,要求在推断时对未知类别具有可靠的泛化能力。虽然现代视觉语言模型(VLM)支持强大的开放词汇识别,但其通过全局对比目标学习的表征对于密集预测仍不够次优,这导致许多OVSS方法依赖于有限的适应或细化图像-文本相似度图,从而限制了在复杂混乱场景中的空间精度和鲁棒性。我们引入dinov3.seg,将dinov3.txt扩展为OVSS的专用框架。我们的贡献有四点:首先,我们设计了一个针对该 backbone 的任务特定架构,系统性地适应了此前开放词汇分割工作中所确立的设计原则。其次,我们联合利用与全局[CLS]标记和局部 patch 级视觉特征对齐的文本嵌入,有效地结合了语义判别与细粒度空间局部性。其次,与依赖主要后事相似度细化的先前方法不同,我们在图像-文本交互之前进行早期视觉表征细化,然后在结果图像-文本相关特征上进行晚期细化,实现了在复杂混乱场景中更准确和更稳健的密集预测。最后,我们提出一种基于滑动窗口聚合的高分辨率局部-全局推理策略,既保留了空间细节,又保持了全局语境。我们在五个广泛采用的数据集上进行了大量实验,以评估我们的方法。结果显示,其有效性和鲁棒性均得到充分体现,始终优于当前最先进的方法。

关键词

引用

@article{arxiv.2603.19531,
  title  = {dinov3.seg: Open-Vocabulary Semantic Segmentation with DINOv3},
  author = {Saikat Dutta and Biplab Banerjee and Hamid Rezatofighi},
  journal= {arXiv preprint arXiv:2603.19531},
  year   = {2026}
}