面向LVLM自评估的视觉感知不确定性量化框架 VAUQ
计算机视觉与模式识别
2026-05-05 v2 人工智能
计算与语言
摘要
大型视觉语言模型(LVLMs)经常产生幻觉,限制了其在实际应用中的安全部署。现有的LLM自评估方法依赖于模型估计自身输出正确性的能力,这有助于提高部署可靠性;然而,它们高度依赖语言先验,因而不适用于评估基于视觉的预测。我们提出 VAUQ(Vision-Aware Uncertainty Quantification),一个面向LVLM自评估的视觉感知不确定性量化框架,显式衡量模型输出对视觉证据的依赖程度。VAUQ引入图像信息得分(Image-Information Score, IS),该得分捕捉由于视觉输入导致的预测不确定性减少,同时引入一种无监督的核心区域遮蔽策略以放大显著区域的影响。将预测熵与该核心遮蔽IS相结合,可得到一种无需训练的评分函数,可可靠地反映答案的正确性。全面的实验表明,VAUQ在多个数据集上 consistently 超过现有的自评估方法。
引用
@article{arxiv.2602.21054,
title = {VAUQ: Vision-Aware Uncertainty Quantification for LVLM Self-Evaluation},
author = {Seongheon Park and Changdae Oh and Hyeong Kyu Choi and Sean Du and Sharon Li},
journal= {arXiv preprint arXiv:2602.21054},
year = {2026}
}
备注
ACL 2026 (Findings)