CLIP 引导的无监督域适应:从 CLIP 度量切入
计算机视觉与模式识别
2024-07-03 v1
摘要
无监督域适应(UDA)已成为解决 labeled source domain 与 unlabeled target domain 之间差异的热门方法。最近,一些研究尝试利用大型视觉语言模型(如 CLIP),然后对其进行微调或学习提示符,以应对这一具有挑战性的 UDA 任务。本文我们转向新的方向,直接利用 CLIP 来衡量域间差异,并提出一种新颖的语言引导方法进行 UDA,称为 CLIP-Div。我们的核心思想是:1)通过获取的 domain-agnostic 分布衡量域间差异;2)利用语言指导校准目标伪标签,以有效缩小域间差距并提高 UDA 模型的泛化能力。具体而言,我们的主要技术贡献在于提出两种新颖的语言引导域间差异度量损失:绝对差异和相对差异。这些损失项为利用 CLIP 派生的 domain-agnostic 分布,对 source 和 target 域的分布对齐提供了精确指导。此外,我们提出了一种语言引导的伪标签生成策略,用于校准目标伪标签。有了它的支持,我们展示了一种进一步的自训练实现,可提高 UDA 模型在 target domain 上的泛化能力。CLIP-Div 在 Office-Home 上超越 SOTA CNN 方法后者提升了 +10.3%,在 Office-31 上提升 +1.5%,在 VisDA-2017 上提升 +0.2%,在 DomainNet 上提升 +24.3%。
引用
@article{arxiv.2407.01842,
title = {CLIP the Divergence: Language-guided Unsupervised Domain Adaptation},
author = {Jinjing Zhu and Yucheng Chen and Lin Wang},
journal= {arXiv preprint arXiv:2407.01842},
year = {2024}
}