中文

无监督域适应的双基座模型

计算机视觉与模式识别 2026-05-06 v1

摘要

语义分割提供了对像素级别场景的理解,对于自动驾驶和细粒度感知任务至关重要。然而,训练分割模型需要对 real-world 数据集进行高成本、耗时的注释。无监督域适应 (UDA) 通过在标注合成数据上训练模型并适应到未标注的 real 图像来解决这一问题。虽然概念上简单,但适应过程面临挑战,即源域与目标域之间在视觉外观和场景结构上的差异。先前方法通过像素级混合或特征级对比学习来桥接这一差距。然而,这些技术面临两个主要局限性:(1) 依赖高置信度伪标签将学习限制在目标域的子集上,(2) 原型基对比方法初始化来自源域训练模型的类原型,导致适应期间原型偏差且不稳定。为解决这些问题,我们提出一种双基座 UDA 框架,利用两个互补的基座模型。首先,我们采用 Segment Anything Model (SAM) 结合超像素引导式提示,使学习能够从更广泛的目标像素范围内获取,超越仅限于高置信度预测。其次,我们整合 DINOv3 来构建稳定、与域无关的类原型,通过其稳健的表示学习。我们的方法在 GTA-to-Cityscapes 和 SYNTHIA-to-Cityscapes 上相对于强大的 UDA 基线分别实现了 +1.3% 和 +1.4% 的 mIoU 提升。

关键词

引用

@article{arxiv.2605.03365,
  title  = {Dual-Foundation Models for Unsupervised Domain Adaptation},
  author = {Yerin Cheon and Aruna Balasubramanian and Francois Rameau},
  journal= {arXiv preprint arXiv:2605.03365},
  year   = {2026}
}

备注

15 pages, 6 figures. Accepted at the 28th International Conference on Pattern Recognition (ICPR 2026)