闭合混淆循环:CLIP引导的对齐实现无源域适应
计算机视觉与模式识别
2026-02-10 v1
摘要
无源域适应(SFDA)解决了在不访问任何源数据的情况下,将预训练源模型适应到无标签目标域的问题,这非常适合数据安全领域。尽管近期进展表明伪标签策略可能有效,但由于细微的类间相似性,它们在细粒度场景中常常失败。一个关键但未被充分探索的问题是存在非对称和动态的类别混淆,其中视觉上相似的类别被源模型不平等且不一致地错误分类。现有方法通常忽略此类混淆模式,导致伪标签噪声大且目标判别能力差。为解决此问题,我们提出CLIP引导对齐(CGA),一种在SFDA中显式建模和缓解类别混淆的新框架。总体而言,我们的方法由三部分组成:(1) MCA:通过分析源模型在目标域中的预测来检测第一方向混淆对;(2) MCC:利用CLIP构建混淆感知的文本提示(例如,看起来像公共汽车的卡车),从而实现更具上下文敏感性的伪标签;(3) FAM:为CLIP和源模型构建混淆引导的特征库,并使用对比学习对齐它们以减少表示空间中的歧义。在各种数据集上的大量实验表明,CGA始终优于最先进的SFDA方法,在易混淆和细粒度场景中尤其显著。我们的结果强调了显式建模类间混淆对于有效无源适应的重要性。我们的代码可在https://github.com/soloiro/CGA找到。
引用
@article{arxiv.2602.08730,
title = {Closing the Confusion Loop: CLIP-Guided Alignment for Source-Free Domain Adaptation},
author = {Shanshan Wang and Ziying Feng and Xiaozheng Shen and Xun Yang and Pichao Wang and Zhenwei He and Xingyi Zhang},
journal= {arXiv preprint arXiv:2602.08730},
year = {2026}
}