中文

ONLY:单层干预足以缓解大型视觉语言模型中的幻觉

计算机视觉与模式识别 2025-07-02 v1 计算与语言

摘要

最近的大型视觉语言模型 (LVLMs) 引入了一种通过文本响应来理解和推理图像输入的新范式。尽管它们在多模态任务中取得了显著的性能,但面临持续的幻觉挑战,这会引入实际弱点并引发对其在真实世界应用中可靠部署的担忧。现有工作探索了对抗解码方法来缓解此问题,其中将原始 LVLM 的输出与扰动版本的输出进行比较和对比。然而,这些方法需要两个或多个查询会降低 LVLM 响应生成速度,使其不太适用于实时应用。为克服这一限制,我们提出了 ONLY,这是一种仅需一个查询和在解码期间进行一次层级干预的训练-free 解码方法,实现了高效的实时部署。具体而言,我们通过针对每个标记的文本到视觉熵比例来选择性地放大关键文本信息。广泛的实验结果表明,我们提出的 ONLY 在各种基准测试中 consistently 优于最先进的方法,同时需要最小的实现工作和计算成本。代码可在 https://github.com/zifuwan/ONLY 上获得。

关键词

引用

@article{arxiv.2507.00898,
  title  = {ONLY: One-Layer Intervention Sufficiently Mitigates Hallucinations in Large Vision-Language Models},
  author = {Zifu Wan and Ce Zhang and Silong Yong and Martin Q. Ma and Simon Stepputtis and Louis-Philippe Morency and Deva Ramanan and Katia Sycara and Yaqi Xie},
  journal= {arXiv preprint arXiv:2507.00898},
  year   = {2025}
}

备注

Accepted by ICCV 2025. Project page: https://zifuwan.github.io/ONLY/