基于视觉-语言基础模型的开放集域适应
计算机视觉与模式识别
2023-08-01 v1
摘要
无监督域适应(UDA)已被证明在将带标签数据的源域中所获知识迁移至带无标签数据的目标域方面非常有效。由于目标域缺乏标签数据且可能存在未知类别,开放集域适应(ODA)已成为在训练阶段识别这些类别的潜在方案。尽管现有 ODA 方法旨在解决源域与目标域间的分布偏移,多数方法在源域上微调 ImageNet 预训练模型并在目标域上适应。近期视觉-语言基础模型(VLFM),如 Contrastive Language-Image Pre-Training(CLIP),对许多分布偏移具有鲁棒性,因此应显著提升 ODA 性能。本工作中,我们探索采用流行 VLFM——CLIP 用于 ODA 的通用方法。我们考察了使用 CLIP 的零样本预测性能,进而提出一种熵优化策略以借助 CLIP 的输出辅助 ODA 模型。所提方法在多个基准上取得当前最优(SOTA)结果,证明了其在解决 ODA 问题上的有效性。
引用
@article{arxiv.2307.16204,
title = {Open-Set Domain Adaptation with Visual-Language Foundation Models},
author = {Qing Yu and Go Irie and Kiyoharu Aizawa},
journal= {arXiv preprint arXiv:2307.16204},
year = {2023}
}