大型视觉语言模型是否知道它们知道什么?对知识边界感知的系统性研究
计算与语言
2025-08-27 v1
摘要
大型视觉语言模型(LVLMs)展示出强大的视觉问答(VQA)能力,但被证明会产生幻觉。可靠的模型应感知其知识边界——即知道它知道什么以及它不知道什么。本文通过评估三种类型的置信信号来研究 LVLMs 对其知识边界的感知:概率置信、答案一致性置信以及言说置信。在三个 LVLMs 跨三个 VQA 数据集的实验中显示,尽管 LVLMs 具备相当程度的感知水平,但仍有显著提升空间。在三种置信中,概率置信和一致性置信信号更可靠,而言说置信常常导致过度自信。为增强 LVLMs 的感知,我们改编了来自大型语言模型(LLMs)的几个已建立置信校准方法,并提出三种有效方法。此外,我们比较了 LVLMs 与其 LLM 对手,发现联合处理视觉和文本输入会降低问答性能但降低置信,从而导致其感知水平优于 LLMs。
引用
@article{arxiv.2508.19111,
title = {Do LVLMs Know What They Know? A Systematic Study of Knowledge Boundary Perception in LVLMs},
author = {Zhikai Ding and Shiyu Ni and Keping Bi},
journal= {arXiv preprint arXiv:2508.19111},
year = {2025}
}
备注
EMNLP2025 Findings