中文

Style-Pro:面向通用视觉语言模型的风格引导式提示学习

计算机视觉与模式识别 2024-11-26 v1

摘要

预训练视觉语言 (vision-language, VL) 模型,如 CLIP,显示出对下游任务具有显著的泛化能力,即使在最小微调的情况下亦然。虽然提示学习 (prompt learning) 已成为有效调整预训练 VL 模型以适应下游任务的策略,但当前方法常常面临对特定下游数据分布严重过拟合的问题。这种过拟合限制了 VL 模型对新领域或未见类别的泛化能力,成为提升 VL 模型可适应性和泛化性的关键挑战。为此,我们提出Style-Pro,一种新型风格引导式提示学习框架,用于缓解过拟合并保留 CLIP 的零-shot 泛化能力。Style-Pro 使用可学习的风格基来合成多样化的分布偏移,由两个专门的损失函数确保风格多样性和内容完整性。随后,为最小化未见领域与源领域之间的差异,Style-Pro 将未见风格映射到已知风格表示空间,作为风格基的加权组合。此外,为了保持风格偏移后提示模型与原始冻结 CLIP 之间的一致性,Style-Pro 引入一致性约束,以保留所学习嵌入中的对齐,最小化在下游任务适应期间的偏差。广泛的实验在 11 个基准数据集上表明,Style-Pro 在各种设置下均显著优于最新方法,包括从基数到新类别的泛化、跨数据集迁移和领域泛化。

关键词

引用

@article{arxiv.2411.16018,
  title  = {Style-Pro: Style-Guided Prompt Learning for Generalizable Vision-Language Models},
  author = {Niloufar Alipour Talemi and Hossein Kashiani and Fatemeh Afghah},
  journal= {arXiv preprint arXiv:2411.16018},
  year   = {2024}
}

备注

Accepted to IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)