中文

学习适用于少样本测试时域适应的冻结 CLIP

机器学习 2025-06-24 v1 计算机视觉与模式识别

摘要

少样本测试时域适应聚焦于仅使用少量无标签样本在测试时适应模型以应对特定领域,从而解决领域迁移问题。先前方法利用 CLIP 的强大分布外 (OOD) 能力,通过生成领域特定的提示来引导其通用、冻结特征。然而,由于下游数据集未被 CLIP 明确看到,仅依赖特征空间知识受限于 CLIP 的先验知识。值得注意的是,使用像 ViT-B/16 这样的较不稳健的骨干网络时,在挑战性的真实世界基准测试中性能会显著下降。鉴于继承 CLIP 内在 OOD 能力的当前最佳实践,本工作提出在输入空间直接学习,以补充冻结 CLIP 的数据集特定知识。具体而言,一个独立的侧支分支并行连接在 CLIP 之后,通过反向注意力被强制学习专有知识。为更好地捕获下游适应的数据集特定标签语义,我们提出通过贪心文本集合和细化来增强文本特征之间的间隔。随后,文本和视觉特征通过生成的领域提示以域感知方式逐步融合,以适应特定领域。广泛实验表明,我们的方法在 5 个大型基准测试 (WILDS 和 DomainNet) 上的优势显著,尤其在 ViT-B/16 等较小网络上显著提升,iWildCam F1 提升 \textbf{+5.1},FMoW WC Acc 提升 \textbf{+3.1\%}。

关键词

引用

@article{arxiv.2506.17307,
  title  = {Learning to Adapt Frozen CLIP for Few-Shot Test-Time Domain Adaptation},
  author = {Zhixiang Chi and Li Gu and Huan Liu and Ziqiang Wang and Yanan Wu and Yang Wang and Konstantinos N Plataniotis},
  journal= {arXiv preprint arXiv:2506.17307},
  year   = {2025}
}

备注

ICLR2025,https://github.com/chi-chi-zx/L2C