中文

基于 LLM 的 Tone-Induced 幻觉评估框架用于评估视觉语言模型

计算机视觉与模式识别 2026-04-28 v3 人工智能

摘要

视觉语言模型 (VLM) 正在增加部署于可靠视觉 grounding 具有实际后果的场景中,但其在逐步强制性提示措辞下的行为仍未充分刻画。现有幻觉基准主要依赖中性提示和二元检测,留存了模型在梯度语言压力下——无论是发生频率还是幻觉强度——如何响应的开放问题。我们提出 Ghost-100,一个由 800 张合成图像构成的基准,覆盖八个类别,分为三个任务家族:文字不可读、时间读取和对象缺失,每个任务均基于负面真相原则构建,确保查询目标在构建时必然缺失、不可读或不可确定。每张图像配有五个来自结构化 5 水平提示强度框架的提示,固定图像和任务身份仅变更指令力度,以将语气作为唯一独立变量。我们采用双轨评估协议:基于规则的 H-Rate 测量模型从基于拒绝的 grounded 回答迈向 unsupported positive commitment 的比例,以及由 GPT-4o-mini 评估的 H-Score(1-5 比例尺)刻画一旦发生幻觉,其信心与具体性。我们另外发布三阶段自动化验证工作流程,对 800 张图像中 717 张进行严格合规性确认。在评估九个开源 VLM 后,我们发现 H-Rate 与 H-Score 在模型家族之间存在显著 dissociate,阅读风格与检测子集对提示压力的响应呈不同方式,多个模型显示在中间语气水平处呈非单调敏感性——这些模式若仅用聚合指标则会被遗漏。

关键词

引用

@article{arxiv.2604.18803,
  title  = {LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models},
  author = {Zhiyuan Jiang and Weihao Hong and Xinlei Guan and Tejaswi Dhandu and Miles Q. Li and Meng Xu and Kuan Huang and Umamaheswara Rao Tida and Bingyu Shen and Daehan Kwak and Boyang Li},
  journal= {arXiv preprint arXiv:2604.18803},
  year   = {2026}
}

备注

23 pages, 12 figures