视觉与视觉语言预训练引导的无源域适应
计算机视觉与模式识别
2024-10-04 v3 机器学习
摘要
无源域适应(SFDA)旨在将在一个完全标注的源域上训练的源模型适应到相关但未标注的目标域。虽然源模型是获取目标伪标签的关键途径,但生成的伪标签可能表现出源偏差。在传统的SFDA流程中,一个大型数据(如ImageNet)预训练的特征提取器用于在源训练开始时初始化源模型,随后被丢弃。尽管预训练的特征提取器具有对泛化重要的多样特征,但在源训练过程中可能过拟合源数据分布并遗忘相关的目标域知识。我们没有丢弃这些宝贵知识,而是引入了一个集成框架,将预训练网络纳入目标适应过程。所提出的框架灵活,允许我们将现代预训练网络插入适应过程以利用其更强的表示学习能力。对于适应,我们提出了Co-learn算法,通过源模型和预训练特征提取器协作提高目标伪标签质量。基于视觉语言模型CLIP在零样本图像识别中的近期成功,我们提出了扩展Co-learn++,进一步融入CLIP的零样本分类决策。我们在4个基准数据集上进行了评估,并包含了更具挑战性的场景,如开放集、部分集和开放部分SFDA。实验结果表明,我们提出的策略提高了适应性能,并且可以成功与现有SFDA方法集成。项目代码可在https://github.com/zwenyu/colearn-plus获取。
引用
@article{arxiv.2405.02954,
title = {Source-Free Domain Adaptation Guided by Vision and Vision-Language Pre-Training},
author = {Wenyu Zhang and Li Shen and Chuan-Sheng Foo},
journal= {arXiv preprint arXiv:2405.02954},
year = {2024}
}
备注
Extension of ICCV paper arXiv:2212.07585; Published at IJCV