中文

视觉语言模型的领域不变提示学习

计算机视觉与模式识别 2026-03-31 v1 人工智能

摘要

大型预训练视觉语言模型如CLIP通过将图像和文本对齐到共享特征空间,彻底改变了计算机视觉,使通过提示进行鲁棒的零样本迁移成为可能。软提示方法,如上下文优化(CoOp),通过学习一组上下文向量有效适配这些模型用于下游识别任务。然而,CoOp缺乏处理跨未见分布领域偏移的显式机制。为解决这一问题,我们提出了领域不变上下文优化(DiCoOp),即CoOp的扩展,专为领域泛化而优化。通过采用对抗训练方法,DiCoOp迫使模型学习领域不变的提示,同时保留分类的判别能力。实验结果表明,DiCoOp在多样化视觉领域的领域泛化任务中持续超越CoOp。

关键词

引用

@article{arxiv.2603.28555,
  title  = {Domain-Invariant Prompt Learning for Vision-Language Models},
  author = {Arsham Gholamzadeh Khoee and Yinan Yu and Robert Feldt},
  journal= {arXiv preprint arXiv:2603.28555},
  year   = {2026}
}