中文

NoLan: 通过动态抑制语言先验缓解大型视觉语言模型中的对象幻觉

计算机视觉与模式识别 2026-02-26 v1 人工智能 计算与语言

摘要

对象幻觉是大型视觉语言模型(LVLMs)中的一个关键问题,其输出中包含输入图像中不存在的对象。从这一现象中自然提出了一个问题:哪一个组件主要导致对象幻觉?是视觉编码器获取视觉信息,还是语言解码器生成文本响应?本文通过设计一种系统性实验来分析视觉编码器和语言解码器在幻觉生成中的作用。我们的观察结果表明,对象幻觉主要与来自语言解码器的强先验相关。在此基础上,我们提出了一种简单且无需训练的框架——无语言幻觉解码(No-Language-Hallucination Decoding, NoLan),通过动态抑制语言先验来细化输出分布,该抑制基于多模态和文本唯一输入之间输出分布的差异。实验结果表明,NoLan 在各种 LVLMs 上针对不同任务有效减少对象幻觉。例如,NoLan 在 POPE 上的准确率提升显著,分别将 LLaVA-1.5 7B 和 Qwen-VL 7B 的准确率提高了最高可达 6.45 和 7.21。该代码已公开 disponible at: https://github.com/lingfengren/NoLan。

关键词

引用

@article{arxiv.2602.22144,
  title  = {NoLan: Mitigating Object Hallucinations in Large Vision-Language Models via Dynamic Suppression of Language Priors},
  author = {Lingfeng Ren and Weihao Yu and Runpeng Yu and Xinchao Wang},
  journal= {arXiv preprint arXiv:2602.22144},
  year   = {2026}
}

备注

Code: https://github.com/lingfengren/NoLan