中文

ReCo:提取器组合缓解视觉语言模型中的幻觉现象

计算机视觉与模式识别 2025-07-01 v1

摘要

视觉语言模型(VLM)在整合和推理视觉与语言数据方面表现出惊人的能力。但这些模型会出错。一个常见发现——类似于大语言模型——是它们倾向于产生不基于视觉输入或最坏情况与之矛盾的 plausible 听起来的文本的幻觉现象。日益形成的共识将这一行为归因于对语言的过度依赖——尤其是当生成进行到后期时,模型会相对于提供的视觉输入 suffer 从“记忆淡化效应”。我们研究了可以控制这种行为的机制。具体而言,我们提出在任何VLM之上添加一个小型可训练模块(称为ReCo),无需其他修改。我们展示,这种轻量级模块能够在三种最常用的VLM(InstructBLIP、LlaVA、MiniGPT4)上缓解记忆淡化效应,在多个基准测试上实现性能提升。此外,我们展示我们的模块可以与其他减少幻觉的许多方法结合,其中我们对每一种方法都实现了改进结果。

关键词

引用

@article{arxiv.2506.22636,
  title  = {ReCo: Reminder Composition Mitigates Hallucinations in Vision-Language Models},
  author = {Sotirios Panagiotis Chytas and Miso Choi and Hyunwoo J. Kim and Vikas Singh},
  journal= {arXiv preprint arXiv:2506.22636},
  year   = {2025}
}