基于冻结多模态基础模型的无源域自适应
计算机视觉与模式识别
2024-03-14 v3
摘要
无源域自适应(SFDA)旨在利用仅可访问的无标签目标训练数据以及在有监督源域上预训练的源模型,将源模型适配到目标域。依赖伪标签和/或辅助监督的传统方法不可避免地容易出错。为缓解这一局限,本工作首次探索了具有丰富而异质知识的现成视觉-语言(ViL)多模态模型(如CLIP)的潜力。我们发现以零样本方式直接将ViL模型应用于目标域并不令人满意,因为它并非专门针对此特定任务,而是相当通用。为使其任务特定化,我们提出了一种新颖的蒸馏多模态基础模型(DIFO)方法。具体而言,DIFO在适配过程中交替执行两步:(i) 以提示学习方式通过最大化与目标模型的互信息来定制ViL模型,(ii) 将该定制ViL模型的知识蒸馏到目标模型。为实现更细粒度且可靠的知识蒸馏,我们进一步引入两个有效的正则化项,即最可能类别鼓励与预测一致性。大量实验表明DIFO显著优于最先进的替代方法。代码见此处
引用
@article{arxiv.2311.16510,
title = {Source-Free Domain Adaptation with Frozen Multimodal Foundation Model},
author = {Song Tang and Wenxin Su and Mao Ye and Xiatian Zhu},
journal= {arXiv preprint arXiv:2311.16510},
year = {2024}
}
备注
Accepted at CVPR 2024