中文

置信度过高:大语言模型与视觉语言模型的言语化不确定性评估

计算机视觉与模式识别 2024-05-07 v1 计算与语言 机器学习

摘要

语言模型和视觉语言模型(LLMs/VLMs)凭借生成类人文本和理解图像的能力,已彻底改变了人工智能领域,但确保其可靠性至关重要。本文旨在评估 LLMs(GPT4、GPT-3.5、LLaMA2 和 PaLM 2)和 VLMs(GPT4V 和 Gemini Pro Vision)通过提示词估计其言语化不确定性的能力。我们提出了新的日本不确定场景数据集(Japanese Uncertain Scenes, JUS),旨在通过困难查询和对象计数测试 VLM 的能力,并提出净校准误差(Net Calibration Error, NCE)来衡量校准误差的方向。结果表明,LLMs 和 VLMs 均存在较高的校准误差,往往显得过于自信,表明其不确定性估计能力较差。此外,我们开发了用于回归任务的提示词,表明 VLMs 在生成均值/标准差和 95% 置信区间时表现不佳。

关键词

引用

@article{arxiv.2405.02917,
  title  = {Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models},
  author = {Tobias Groot and Matias Valdenegro-Toro},
  journal= {arXiv preprint arXiv:2405.02917},
  year   = {2024}
}

备注

8 pages, with appendix. To appear in TrustNLP workshop @ NAACL 2024