中文

StyLIP:面向基于CLIP的领域泛化的多尺度风格条件提示学习

计算机视觉与模式识别 2023-11-30 v3

摘要

大规模基础模型,如CLIP,利用精心设计的语言提示,在下游任务上展现了令人印象深刻的零样本泛化性能。然而,这些提示学习技术常常难以应对领域偏移,限制了其泛化能力。在我们的研究中,我们通过提出StyLIP——一种用于领域泛化(DG)的新方法——来解决这一问题,该方法增强了CLIP跨领域的分类性能。我们的方法专注于一种领域无关的提示学习策略,旨在解耦嵌入在CLIP预训练视觉编码器中的视觉风格与内容信息,从而在推理时能够轻松适应新领域。为实现这一目标,我们引入了一组风格投影器,它们直接从提取的多尺度风格特征中学习领域特定的提示词元。这些生成的提示嵌入随后与由内容投影器学习的多尺度视觉内容特征相结合。投影器以对比学习方式进行训练,利用CLIP固定的视觉和文本骨干网络。通过在多个基准数据集上对五种不同的DG设置进行广泛实验,我们一致证明StyLIP优于当前最先进(SOTA)的方法。

关键词

引用

@article{arxiv.2302.09251,
  title  = {StyLIP: Multi-Scale Style-Conditioned Prompt Learning for CLIP-based Domain Generalization},
  author = {Shirsha Bose and Ankit Jha and Enrico Fini and Mainak Singha and Elisa Ricci and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2302.09251},
  year   = {2023}
}

备注

23 pages,5 figures, 7 tables, Accepted in WACV 2024