TRUST:利用文本鲁棒性实现无监督域适应
计算机视觉与模式识别
2025-08-11 v1 机器学习
摘要
近期的无监督域适应 (UDA) 方法在解决经典域迁移(如合成到真实)方面取得了很大成功,但在面对复杂迁移(如地理迁移)时仍受限,因为背景和物体外观在不同域之间差异显著。先前的研究表明,语言模态可有助于适应过程,具有对此类复杂迁移的更强鲁棒性。在本文中,我们引入 TRUST,一种新型 UDA 方法,利用语言模态的鲁棒性来指导视觉模型的适应。TRUST 从样本的标题生成伪标签,并引入一种新颖的不确定性估计策略,该策略使用归一化 CLIP 相似度得分来估计生成伪标签的不确定性。这种估计的不确定性随后用于重新加权分类损失,从而减轻来自低质量标题所产生的错误伪标签的不利影响。为了进一步提高视觉模型的鲁棒性,我们提出了一种多模态软对比学习损失,通过利用标题引导视觉模型在目标图像上的对比训练来对齐视觉和语言特征空间。在我们的对比损失中,每一对图像既是正样本也是负样本,其特征表示的吸引力和排斥力与其标题的相似度成正比。这一解决方案避免了在 UDA 设置中确定正负样本的困难问题。我们的做法在经典(DomainNet)和复杂(GeoNet)域迁移上均超越了先前方法,树立了新的 SOTA。代码将在接受后公开。
引用
@article{arxiv.2508.06452,
title = {TRUST: Leveraging Text Robustness for Unsupervised Domain Adaptation},
author = {Mattia Litrico and Mario Valerio Giuffrida and Sebastiano Battiato and Devis Tuia},
journal= {arXiv preprint arXiv:2508.06452},
year = {2025}
}