中文

AD-CLIP:在提示空间中利用 CLIP 进行域适配

计算机视觉与模式识别 2024-09-17 v2

摘要

尽管深度学习模型在有监督学习任务上表现出令人印象深刻的性能,但当训练(源)域与测试(目标)域不同时,它们往往难以很好地泛化。无监督域适配(DA)已成为解决该问题的一种流行方案。然而,当前的 DA 技术依赖于视觉骨干网络,这可能缺乏语义丰富性。尽管像 CLIP 这样的大规模视觉-语言基础模型具有潜力,但其在 DA 上的有效性尚待充分探索。为弥补这一空白,我们提出了 \textsc{AD-CLIP},一种用于 CLIP 的域无关提示学习策略,旨在提示空间中解决 DA 问题。我们利用 CLIP 的冻结视觉骨干网络提取图像风格(域)与内容信息,并将其用于学习提示词元。我们的提示通过同时以图像风格和内容特征为条件进行提示学习,被设计为域不变且类别可泛化的。我们在源域中使用标准有监督对比学习,同时提出一种熵最小化策略,在给定目标域数据的情况下在嵌入空间中对齐域。我们还考虑了一种测试期间仅可用目标域样本、无任何源域数据的场景,并提出了一种跨域风格映射网络来幻觉出域无关词元。我们在三个基准 DA 数据集上的大量实验证明了 \textsc{AD-CLIP} 相对于现有文献的有效性。代码可在 \url{https://github.com/mainaksingha01/AD-CLIP} 获取。

关键词

引用

@article{arxiv.2308.05659,
  title  = {AD-CLIP: Adapting Domains in Prompt Space Using CLIP},
  author = {Mainak Singha and Harsh Pal and Ankit Jha and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2308.05659},
  year   = {2024}
}

备注

10 pages, 8 figures, 4 tables. Accepted at OOD-CV, ICCV Workshop, 2023