中文

MSGCoOp:用于few-shot学习的多语义引导上下文优化

计算机视觉与模式识别 2025-07-30 v1

摘要

视觉语言预训练模型 (VLM) 如CLIP已显示出惊人的零样 generalizes 能力,提示学习 (prompt learning) 已成为高效的全调优替代方案。然而,现有方法常在针对新类别时难以实现generalization,这归因于对已见类别的过拟合以及遗忘通用知识。此外,近期改进generalization的方法常引入复杂的架构或高计算开销。本文提出了多语义引导上下文优化 (MSGCoOp) 框架,以在保持计算效率的同时增强few-shot generalization。该方法利用平行可学习上下文向量的ensemble来捕获多样化的语义方面。为丰富这些提示,我们引入语义引导机制,将其与由大语言模型 (LLM) 自动生成的全面类描述对齐。此外,diversity正则化损失鼓励提示学习互补且正交的特征,防止其坍缩为冗余表示。广泛的实验表明,MSGCoOp在从base到novel的generalization方面显著提升性能,相较于强大的KgCoOp基线,实现平均调和平均性能提升1.10%。本方法在cross-domain generalization任务中也显示出增强的robustness。我们的代码可在 \href{https://github.com/Rain-Bus/MSGCoOp}{https://github.com/Rain-Bus/MSGCoOp} 获取。

关键词

引用

@article{arxiv.2507.21786,
  title  = {MSGCoOp: Multiple Semantic-Guided Context Optimization for Few-Shot Learning},
  author = {Zhaolong Wang and Tongfeng Sun and Mingzheng Du and Yachao Huang},
  journal= {arXiv preprint arXiv:2507.21786},
  year   = {2025}
}