中文

深度空间一致性提升领域泛化语义分割中的视觉基础模型

计算机视觉与模式识别 2025-07-16 v3

摘要

视觉基础模型(VFMs)在领域泛化语义分割(DGSS)中取得了显著的性能。然而,近期方法常常忽视了视觉线索易受影响,而底层几何结构保持稳定,这使得深度信息更具鲁棒性。本文探讨了将深度信息与VFMs特征集成以提高图像中几何一致性并提升VFMs泛化性能的潜力。我们提出了一种新颖的微调DGSS框架,称为DepthForge,该框架将来自冻结的DINOv2或EVA02的视觉线索与来自冻结Depth Anything V2的深度线索相结合。在VFMs的每一层中,我们包含深度感知可学习标记,以持续解耦域无关的视觉信息和空间信息,从而增强深度感知和注意力。最后,我们开发了一个深度细化解码器并将其集成到模型架构中,以适应性地细化多层VFM特征和深度感知可学习标记。在各种DGSS设置和五个不同数据集作为未见目标域上进行大量实验。定性和定量结果表明,我们的方法在性能、稳定的视觉-空间注意力和优越的泛化能力方面显著优于替代方法。特别是,DepthForge在极端条件下表现突出(例如夜晚和雪天)。代码可在 https://github.com/anonymouse-xzrptkvyqc/DepthForge 获取。

关键词

引用

@article{arxiv.2504.12753,
  title  = {Stronger, Steadier & Superior: Geometric Consistency in Depth VFM Forges Domain Generalized Semantic Segmentation},
  author = {Siyu Chen and Ting Han and Changshe Zhang and Xin Luo and Meiliu Wu and Guorong Cai and Jinhe Su},
  journal= {arXiv preprint arXiv:2504.12753},
  year   = {2025}
}

备注

Accepted by ICCV 2025