VFM-UDA++:提升无监督域适应语义分割中的网络架构与数据策略
计算机视觉与模式识别
2025-08-12 v2 图像与视频处理
摘要
无监督域适应(UDA)使模型能够从带标签的源域泛化到未标注的目标域,通常数据有限。与此同时,大规模无标签预训练的视觉基础模型(VFMs)也展现出卓越的下游性能和泛化能力。这促使我们探讨UDA如何最佳利用VFMs。先前工作(VFM-UDA)表明,用VFM取代标准ImageNet预训练编码器可提升泛化性能。然而,它也表明,当应用于VFMs时,常用的特征距离损失会损害性能。此外,VFM-UDA未纳入多尺度归纳偏置,而多尺度归纳偏置已知可改善语义分割。基于这些洞见,我们提出VFM-UDA++,其(1)探讨多尺度特征的作用,(2)将特征距离损失适配ViT-based VFMs,(3)评估增加合成源数据和真实目标数据对UDA的益处。在回答这些问题后,我们在标准的GTA5 Cityscapes基准上提高了+1.4 mIoU。虽然先前的非VFM UDA方法无法随数据增多而提升,但VFM-UDA++在扩大数据规模后仍持续提升,实现了额外的+2.4 mIoU提升,表明VFM-based UDA继续从更多数据中受益。
引用
@article{arxiv.2503.10685,
title = {VFM-UDA++: Improving Network Architectures and Data Strategies for Unsupervised Domain Adaptive Semantic Segmentation},
author = {Brunó B. Englert and Gijs Dubbelman},
journal= {arXiv preprint arXiv:2503.10685},
year = {2025}
}