中文

眼见为实,但可信几何?视觉语言模型中言语化校准的全面分析

计算机视觉与模式识别 2025-05-27 v1

摘要

不确定性量化对于评估现代人工智能系统的可靠性和可信度至关重要。在现有方法中,言语化不确定性——即模型通过自然语言表达其置信度——已成为大语言模型(LLM)中一种轻量级且可解释的解决方案。然而,其在视觉语言模型(VLM)中的有效性仍未得到充分研究。在这项工作中,我们对 VLM 中的言语化置信度进行了全面评估,涵盖三个模型类别、四个任务领域和三种评估场景。我们的结果表明,当前的 VLM 在不同任务和场景中经常表现出显著的校准误差。值得注意的是,视觉推理模型(即,通过图像进行思考)始终展现出更好的校准效果,这表明特定于模态的推理对于可靠的不确定性估计至关重要。为了进一步解决校准挑战,我们引入了视觉置信度感知提示,这是一种两阶段提示策略,旨在改善多模态场景中的置信度对齐。总体而言,我们的研究揭示了 VLM 跨模态固有的校准误差。更广泛地说,我们的发现强调了模态对齐和模型忠实性在推进可靠的多模态系统中的根本重要性。

关键词

引用

@article{arxiv.2505.20236,
  title  = {Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models},
  author = {Weihao Xuan and Qingcheng Zeng and Heli Qi and Junjue Wang and Naoto Yokoya},
  journal= {arXiv preprint arXiv:2505.20236},
  year   = {2025}
}