中文

Urban-Scene Segmentation中的Open-Vocabulary Domain Generalization

计算机视觉与模式识别 2026-03-10 v2

摘要

语义分割中的域泛化(DG-SS)旨在使分割模型在未知环境中能够稳健地运行。然而,传统的DG-SS方法受限于固定的已知类别集合,限制了其在开放世界场景中的应用。近期进展在视觉语言模型(VLM)为开放词汇语义分割(OV-SS)带来了进展,通过使模型能够识别更广泛的概念。然而,这些模型对域偏移仍然敏感,在部署到未知环境时难以保持稳健性,这在城市驾驶场景中尤为严重。为填补这一差距,我们提出了语义分割中的Open-Vocabulary Domain Generalization(OVDG-SS),这是一种全新设定,同时解决未知域和未知类别的问题。我们引入了OVDG-SS在自动驾驶领域的首个基准,涵盖了以前未探索的问题,覆盖多样化的未知域和未知类别的合成到真实以及真实到真实的泛化。我们观察到,域偏移常常扭曲预训练VLM中的文本-图像相关性,这会阻碍OV-SS模型的性能。为解决这一挑战,我们提出了S2-Corr,一种受状态空间驱动的文本-图像相关性细化机制,用于缓解域引起的扭曲,产生在分布变化下更一致的文本-图像相关性。广泛的实验表明,所提出的方法在现有OV-SS方法的跨域性能和效率方面具有优势。

关键词

引用

@article{arxiv.2602.18853,
  title  = {Open-Vocabulary Domain Generalization in Urban-Scene Segmentation},
  author = {Dong Zhao and Qi Zang and Nan Pu and Wenjing Li and Nicu Sebe and Zhun Zhong},
  journal= {arXiv preprint arXiv:2602.18853},
  year   = {2026}
}