重新思考源模型的必要性:受视觉语言模型指导的从零开始的源免除域适应
计算机视觉与模式识别
2026-05-05 v1
摘要
源域自由域适应 (SFDA) 在不访问源数据的情况下将源模型适应到目标域,解决了隐私和传输问题。然而,现有方法仍然从源预训练模型初始化,因此并非真正源免除。近期研究引入了视觉语言 (ViL) 模型来指导适应过程,在这些方法中,我们注意到对于相同的目标域,不同的源模型会导致最终结果几乎没有差异,表明源模型本身的影响有限。为此,我们提出了 ViL-Only Domain Adaptation (VODA),一种更严格的设置,消除对源域的所有依赖,仅依赖随机初始化的模型、ViL 模型和无标签目标数据。我们分析了 VODA 的适应动力学,提出了 Two-Stage Denoised-Region Distillation (TS-DRD),一个两阶段框架:首先通过 ViL 指导进行热身,然后寻找 ViL 与适应模型中固有的 Denoised-Region,为蒸馏提供更干净的监督。在 Office-Home、VisDA 和 DomainNet-126 上实验表明,在 VODA 设置下,TS-DRD 达到了与现有仍使用源模型的 SFDA 方法相当或更好的性能,展示了其有效性以及 VODA 设置的潜力。
引用
@article{arxiv.2605.02604,
title = {Rethinking the Need for Source Models: Source-Free Domain Adaptation from Scratch Guided by a Vision-Language Model},
author = {Zhou Bingtao and Xiang Mian and Ning Qian},
journal= {arXiv preprint arXiv:2605.02604},
year = {2026}
}