多源无监督域适应的多提示渐进对齐
计算机视觉与模式识别
2025-08-01 v1
摘要
大型视觉语言模型如 CLIP 因其强大的零样本泛化能力,已成为无监督域适应的强大基础。当前最先进的方法通常利用 CLIP 为目标域生成伪标签,然后微调模型以学习域不变特征。然而,这些方法试图同时使用所有伪标记数据对齐源域和目标域。这种单次对齐在面对噪声、难以分类的样本时会存续问题,导致误差传播和亚optimal特征学习。在多源场景下,由于跨越多个源域的差异化域间隙和各源域噪声水平的差异,问题更为严重,进一步 destabilize 对齐过程。为此,本文提出一种针对无标记下游任务的渐进式对齐策略。该方法首先在目标样本的高置信度子集上训练模型,使其从最可靠的数据中学习到良好的对齐表示。随着训练推进,逐步纳入更具挑战性的样本,引导模型在不被初始标签噪声淹没的情况下,细化其理解。这种渐进方法有效缓解了确认偏差,促进了更稳健的收敛,使模型能够学习到真正的域不变特征。我们称之为 MP^2A,并在三个流行的无监督域适应基准测试中进行测试,包括 ImageCLEF、Office-Home 以及最具挑战性的 DomainNet。实验结果表明,MP^2A 在与大多数最新 CLIP-based MS-UDA 方法进行比较后,实现了最先进的性能,证明了我们方法的有效性。
引用
@article{arxiv.2507.23373,
title = {Multi-Prompt Progressive Alignment for Multi-Source Unsupervised Domain Adaptation},
author = {Haoran Chen and Zexiao Wang and Haidong Cao and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2507.23373},
year = {2025}
}