通过语义高斯过程提高大型视觉语言模型中语义不确定性量化
计算机视觉与模式识别
2026-03-31 v2
摘要
大型视觉语言模型 (LVLMs) 常常会产生看似合理但不可靠的输出,使得稳健的不确定性估计至关重要。最近的语义不确定性估计工作依赖于外部模型对多个采样响应进行聚类并衡量其语义一致性。然而,这些聚类方法往往脆弱,对细微的措辞变化高度敏感,并且可能错误地对语义相似的答案进行错误分组或分离,从而导致不可靠的不确定性估计。我们提出语义高斯过程不确定性 (SGPU),一种贝叶斯框架,通过分析答案嵌入的几何结构来量化语义不确定性,避免脆弱的聚类。SGPU 将生成的答案映射到稠密的语义空间,计算其嵌入的格拉姆矩阵,并通过其本征谱总结其语义配置。这种谱表示然后输入到高斯过程分类器中,用于学习语义一致性模式与预测不确定性之间的映射,可用于黑盒和白盒设置。我们在涵盖 VQA、图像分类和文本 QA 的八个数据集上,对六个 LLMs 和 LVLMs 进行测试,SGPU 在校准 (ECE) 和判别 (AUROC, AUARC) 性能方面始终实现了最先进的水平。我们进一步展示了 SGPU 在不同模型和模态之间的迁移能力,表明其谱表示捕捉到了语义不确定性的通用模式。
引用
@article{arxiv.2512.14177,
title = {Improving Semantic Uncertainty Quantification in LVLMs with Semantic Gaussian Processes},
author = {Joseph Hoche and Andrei Bursuc and David Brellmann and Gilles Louppe and Pavel Izmailov and Angela Yao and Gianni Franchi},
journal= {arXiv preprint arXiv:2512.14177},
year = {2026}
}