VFM时代的无监督域适应器有何新增价值?
计算机视觉与模式识别
2025-04-28 v1
摘要
无监督域适应(UDA)可从标记源域数据提升感知模型对未标记目标域的泛化能力。使用基于视觉基础模型(VFM)的UDA可实现与完全监督学习(使用真实目标数据)相当的泛化性能。然而,由于VFM在预训练中已具备强大的泛化能力,对目标域进行简单的源域微调也能表现良好。鉴于学术研究中使用的数据情景不一定能代表实际应用场景,目前尚不清楰(a)UDA在更具代表性和多样性的数据下如何表现,(b)源域微调的VFM在这些情境下是否同样出色。本研究旨在弥合这些差距,并聚焦于语义分割作为典型感知任务。我们评估了合成到真实、真实到真实的UDA场景,涵盖不同的数据组合。我们还考察了在UDA中使用少量标记目标数据效果。我们阐明,尽管这些情境更真实,但并不一定更具挑战性。结果表明,采用更强大的合成源数据时,UDA相对于VFM源域微调的提升从8个mIoU降至2个mIoU;而采用更具多样性的真实源数据时,UDA无显著价值。然而,UDA在所有合成数据情境下的泛化能力始终高于源域微调,并且仅使用1/16的Cityscapes标签,合成UDA即可获得与完全监督模型(使用全部标签)相当的85个mIoU的领先分割质量。鉴于结果呈现差异,我们讨论了UDA如何在大规模自主驾驶中发挥最佳作用。
引用
@article{arxiv.2504.18190,
title = {What is the Added Value of UDA in the VFM Era?},
author = {Brunó B. Englert and Tommie Kerssies and Gijs Dubbelman},
journal= {arXiv preprint arXiv:2504.18190},
year = {2025}
}