中文

后验概率视觉语言模型

计算机视觉与模式识别 2026-02-16 v5 机器学习

摘要

视觉语言模型(VLM),如 CLIP 和 SigLIP,在分类、检索和生成任务中取得了显著的成功。为此,VLM 确定性地将图像和文本描述映射到共享的潜在空间,并通过余弦相似度进行相似性评估。然而,确定性输入映射在下游任务中因域迁移引起概念不确定性时,难以捕获这种不确定性。本文提出了一种无需额外训练的后验不确定性估计方法。该方法利用 VLM 最后一层的贝叶斯后验近似,对余弦相似度进行解析化的不确定性量化。我们展示了其在不确定性量化和支持集选择中的有效性。与基线方法相比,我们获得了改进且校准良好的预测不确定性、可解释的不确定性估计以及样本高效的主动学习。我们的结果显示出在大规模模型的安全关键应用中具有潜力。

关键词

引用

@article{arxiv.2412.06014,
  title  = {Post-hoc Probabilistic Vision-Language Models},
  author = {Anton Baumann and Rui Li and Marcus Klasson and Santeri Mentu and Shyamgopal Karthik and Zeynep Akata and Arno Solin and Martin Trapp},
  journal= {arXiv preprint arXiv:2412.06014},
  year   = {2026}
}

备注

Published at ICLR 2026. Project page: https://aaltoml.github.io/BayesVLM/