中文

用于缓解多模态大语言模型幻觉的中间层提取视觉事实方法

计算机视觉与模式识别 2025-07-22 v1

摘要

多模态大语言模型 (MLLMs) 通过结合视觉识别和语言理解实现了显著进展,能够生成既连贯又在上下文方面准确的内容。然而,MLLMs 仍在处理对象幻觉方面存在挑战,即模型生成看似合理但事实错误的输出,包括图像中不存在的对象。最近的研究表明,MLLMs 中的先验知识显著抑制了深层中的视觉信息,从而导致幻觉性输出。然而,这些先验如何在 MLLMs 的中间层阶段抑制视觉信息仍不清晰。我们观察到,视觉事实知识以及中间层先验/原始概率分布之间的差异在中间层中呈现类似的演化趋势。基于此,我们引入解码 by 提取视觉事实 (EVA),这是一种简单且无需训练的方法,通过动态选择具有最显著视觉事实信息的中间层。通过对比所选层来自原始输入和纯文本输入的输出分布,EVA 提取视觉事实知识并按比例纳入最终层以纠正输出 logits。重要的是,EVA 是模型无关的,可无缝集成到各种经典解码策略中,并适用于各种 MLLMs。我们在广泛使用的基准测试上对 EVA 进行了验证,结果表明其显著降低了与基线方法相比的幻觉率,凸显了其在缓解幻觉方面的有效性。

关键词

引用

@article{arxiv.2507.15652,
  title  = {Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models},
  author = {Haoran Zhou and Zihan Zhang and Hao Chen},
  journal= {arXiv preprint arXiv:2507.15652},
  year   = {2025}
}