grounding 还是猜测?基于盲图对比排序的大视觉语言模型置信度估计
计算与语言
2026-05-18 v2
摘要
大型视觉语言模型存在视觉非 grounding 问题:它们可以生成流畅、自信甚至正确的回答,完全依赖语言先验,图像对预测毫无贡献。现有的置信度估计方法无法检测这种现象,因为它们仅观察正常推理过程下的模型行为,缺乏判断预测是受图像还是文本alone影响的机制。我们引入BICR(Blind-Image Contrastive Ranking,盲图对比排序),一个模型无关的置信度估计框架,通过在训练时显式对比来实现这一目标:当给定真实图像-问题配对时提取模型隐藏状态,以及当图像被置黑而问题保持不变时提取的隐藏状态。一个轻量探针在真实图像隐藏状态上进行训练,并通过排序损失进行正则化,该损失惩罚黑白图视图上更高的置信度,从而在零额外推理成本下教导其将视觉 grounding 视为可靠性信号。我们在覆盖视觉问答、对象幻觉检测、医学成像和金融文件理解等七个基准测试中的五个现代 LVLM 和七个基线上进行评估,BICR 在校准和判别性上实现了跨 LVLM 的最佳平均表现,统计显著性判别性提升在聚类感知分析下稳健,且参数数量比最强探针基线少 4-18 倍。
关键词
引用
@article{arxiv.2605.10893,
title = {Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking},
author = {Reza Khanmohammadi and Erfan Miahi and Simerjot Kaur and Charese H. Smiley and Ivan Brugere and Kundan Thind and Mohammad M. Ghassemi},
journal= {arXiv preprint arXiv:2605.10893},
year = {2026}
}