基于证据不确定性量化的大型视觉语言模型行为检测
机器学习
2026-02-27 v2
摘要
大型视觉语言模型(LVLMs)在多模态理解和生成方面取得了显著进展。然而,在面对低能或对抗性输入时,它们常常会产生不可靠甚至有害的内容,如事实幻觉或危险指令。这种与人类期望不符的现象,称为 LVLMs 的\emph{行为失控},引发了在关键应用中部署的严重顾虑。这些行为失控源于于认识论不确定性,具体而言是内部知识冲突或缺乏支持信息。然而,现有的不确定性量化方法通常仅捕获整体认识论不确定性,在识别此类问题方面效果有限。为填补这一差距,我们提出证据不确定性量化(EUQ),一种细粒度方法,捕获信息冲突和无知,以有效检测 LVLMs 的行为失控。具体而言,我们将模型输出头部的特征解释为支持(正)或反对(负)证据。基于证据理论,我们对该证据进行建模和聚合,以单次前向传播量化内部冲突和知识缺口。我们广泛评估了该方法在四类行为失控中的效果,包括幻觉、越狱、对抗性脆弱性和超出分布(OOD)失败,测试对象为最先进的 LVLMs,发现 EUQ 在强基准上 consistently 优于,且发现幻觉对应于高内部冲突,OOD 失败对应于高无知。此外,基于层次的证据不确定性动力学分析有助于从新视角解释内部表示的演化。源代码:https://github.com/HT86159/EUQ
引用
@article{arxiv.2602.05535,
title = {Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification},
author = {Tao Huang and Rui Wang and Xiaofei Liu and Yi Qin and Li Duan and Liping Jing},
journal= {arXiv preprint arXiv:2602.05535},
year = {2026}
}
备注
Accepted to ICLR 2026. Code is available at https://github.com/HT86159/EUQ