中文

冻结视觉语言模型的概率嵌入:基于高斯过程潜在变量模型的不确定性量化

计算机视觉与模式识别 2025-07-08 v2 机器学习

摘要

视觉语言模型(VLMs)通过将图像和文本映射到共享潜在空间来学习联合表示。然而,近期研究表明,标准VLMs生成的确定性嵌入往往难以捕捉源于视觉和文本描述模糊性以及图像-文本之间多种可能对应关系所引发的不确定性。现有方法通过学习概率嵌入来解决此问题,这需要大量数据且未能利用来自大规模VLMs(如 CLIP)的强大表示。本文提出GroVE,一种从冻结VLMs中获取概率嵌入的后处理方法。GroVE基于高斯过程潜在变量模型(GPLVM)构建,学习共享低维潜在空间,将图像和文本输入映射到统一表示,通过单模态嵌入重建和跨模态对齐目标进行优化。训练后,高斯过程模型生成具有不确定性感知的概率嵌入。评估显示,GroVE在跨模态检索、视觉问答和主动学习等多个下游任务上实现了不确定性校准方面的SOTA。

关键词

引用

@article{arxiv.2505.05163,
  title  = {Probabilistic Embeddings for Frozen Vision-Language Models: Uncertainty Quantification with Gaussian Process Latent Variable Models},
  author = {Aishwarya Venkataramanan and Paul Bodesheim and Joachim Denzler},
  journal= {arXiv preprint arXiv:2505.05163},
  year   = {2025}
}

备注

UAI 2025, 22 pages