中文

面向视觉语言模型的多模态相互指导条件提示学习

计算机视觉与模式识别 2025-07-14 v1

摘要

提示学习促进了视觉语言模型 (VLM) 高效适应各种下游任务,但面临两个显著挑战:(1) 不足地建模未见实例的类嵌入分布,导致在新类上的泛化次优;(22) 现有方法主要将跨模态对齐局限于视觉和文本编码器的最终输出层,这从根本上限制了其与预训练多模态嵌入空间保持拓扑一致性的能力。为此,我们引入了 MuGCP (Multi-modal Mutual-Guidance Conditional Prompt Learning),一种新的条件提示生成范式。MuGCP 利用多模态大语言模型 (MLLM) 作为条件提示学习器,适应性地生成包含丰富、精细的高层次语义知识的语义条件提示 (SCP)。为确保视觉语言模型 (VLM) 跨模态空间的有效对齐和交互,我们引入注意力相互指导 (AMG) 模块,促进视觉信息与语义信息之间的相互作用。通过相互指导,AMG 模块生成视觉条件提示 (VCP),增强模型在多模态任务中的性能。此外,我们提出了多提示融合 (MPF) 机制,将 SCP 和 VCP 与情境提示集成,确保不同提示之间顺畅的协调,并增强对类嵌入和实例特定知识的建模。我们的 MuGCP 在 14 个不同数据集上超越了现有的 SOTA 方法。代码将在发表后公开。

关键词

引用

@article{arxiv.2507.08410,
  title  = {Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models},
  author = {Shijun Yang and Xiang Zhang and Wanqing Zhao and Hangzai Luo and Sheng Zhong and Jinye Peng and Jianping Fan},
  journal= {arXiv preprint arXiv:2507.08410},
  year   = {2025}
}

备注

21 pages, 8 figures