中文

GEASS:面向视觉语言模型的 Gated Evidence-Adaptive Selective Caption Trust

计算机视觉与模式识别 2026-05-20 v2 人工智能

摘要

视觉语言模型(VLM)在基于 grounding 的推理方面表现出色,但仍容易产生 object hallucination。最近的工作将自生成的 caption 作为统一正向资源,但我们发现盲目嵌入 caption 反而会降低表现——在 HallusionBench 上将 Qwen2.5-VL-3B 的准确率下降近 10 分。两个结构属性解释了这一现象。首先,caption 不仅锚定模型的最终答案,还锚定其推理轨迹和词汇选择。其次,caption 错误具有非对称性:遗漏远多于虚构,但每次虚构的单实例影响更大。因此,caption 的有用性是每个查询属性,而非每个语料库属性。我们提出了 GEASS(ated Evidence-Adaptive Selective Caption Trust),一个无训练的模块,用于决定每个查询模型消耗 caption 的程度:它通过干净路径的置信度对 caption 进行门控,对其进行熵 reduction 加权,并在两条路径不一致时提高 evidence 门槛。在 POPE 和 HallusionBench 上的实验表明,GEASS 在四个 VLM 上 consistently 超过 vanilla 推理和对抗解码,仅需每个查询额外两个前向传播。

关键词

引用

@article{arxiv.2605.01733,
  title  = {GEASS: Gated Evidence-Adaptive Selective Caption Trust for Vision-Language Models},
  author = {Zeshang Li and Shuoyang Zhang},
  journal= {arXiv preprint arXiv:2605.01733},
  year   = {2026}
}

备注

11 pages, 6 figures