中文

基于视觉语言先验的源自由域适应

计算机视觉与模式识别 2026-04-21 v1

摘要

源自由域适应(SFDA)旨在仅 access unlabeled target training data 的条件下,将在监督 source domain 上预训练的 source model 适用于 target domain。依赖伪标签和/或辅助监督的传统方法不可避免地存在误差问题。为缓解这一局限,本文首次探索离线视觉语言(ViL)多模态模型(如 CLIP)的潜力,这些模型拥有丰富且异构的知识。我们发现,直接以零样本方式将 ViL 模型应用于 target domain 是不够的,因为其通用性较强,无法针对特定任务进行优化。为使其具备任务特定性,我们提出了一种新型 DIFO++ 方法。具体而言,DIFO++ 在适应过程中交替进行两个步骤:(i)通过提示学习最大化 ViL 模型与 target model 之间的互信息进行定制化;(ii)以 gap region 为中心,将该定制化 ViL 模型的知识蒸馏到 target model。通过渐进式知识适应,首先识别并聚焦于 gap region,即特征交织且类别模糊的区域,这通常捕获更丰富的任务特定语义。随后通过融合来自 target 和 ViL 模型的预测结果(并辅以记忆机制)生成可靠的伪标签。最后,通过类别注意力和预测一致性实现语义对齐,辅以参考熵最小化抑制不确定性。广泛的实验表明,DIFO++ 在多个基线方法上均显著优于当前最先进的方法。我们的代码和数据已公开于 https://github.com/tntek/DIFO-Plus。

关键词

引用

@article{arxiv.2604.17748,
  title  = {Source-Free Domain Adaptation with Vision-Language Prior},
  author = {Song Tang and Yunxiang Bai and Wenxin Su and Mao Ye and Jianwei Zhang and Xiatian Zhu},
  journal= {arXiv preprint arXiv:2604.17748},
  year   = {2026}
}