中文

从点到云:学习多模态提示的鲁棒语义分布

计算机视觉与模式识别 2025-12-01 v1

摘要

多模态提示学习(MPL)已成为适应大规模视觉语言模型(VLMs)的关键技术。然而,当前的MPL方法受限于其优化单一、静态点表示的范式。这一范式本质上脆弱,导致在基类上的过拟合,并对新型或模糊类别的泛化能力差。我们挑战了这种点范式,提出鲁棒泛化需要学习语义云(即在嵌入空间上的分布)。为实现这一目标,我们引入了点到云(P2C),一种受扩散模型启发的新型框架,将提示学习重新表述为动态去噪任务。P2C的核心是双重去噪机制:动态提示去噪(DPD)机制通过精细的退火噪声扰动文本提示,以学习更平滑的语义景观;另外,一个辅助的视觉-语言映射器去噪损失将映射器重新任务设计为去噪自编码器。这迫使映射器从噪声文本输入中重建干净的视觉提示,从而确保稳健的跨模态对齐。广泛的实验表明,P2C consistently优于强大的基线方法。在从基类到新类的泛化基准测试中,我们的方法实现了79.7%的调和平均值,相对于基线实现了1.4%的相对改进。代码和模型均可用https://vranlee.github.io/P2C/获取。

关键词

引用

@article{arxiv.2511.22897,
  title  = {From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts},
  author = {Weiran Li and Yeqiang Liu and Yijie Wei and Mina Han and Xin Liu and Zhenbo Li},
  journal= {arXiv preprint arXiv:2511.22897},
  year   = {2025}
}