中文

逆转过度依赖陷阱:基于自验证框架的 LVLMs 对象幻觉缓解

计算机视觉与模式识别 2026-04-09 v2 人工智能

摘要

尽管大型视觉语言模型(Large Vision Language Models, LVLMs)取得了显著进展,但对象幻觉(object hallucination)仍是图像描述任务中的关键问题,即模型生成描述非存在物体的文本,损害其可靠性。先前工作将此归因于 LVLMs 对语言先验的过度依赖,试图通过 logits 校准来缓解,但仍缺乏对过度依赖的深入分析。为深入理解过度依赖,我们进行一系列初步实验,表明随生成长度增加,LVLMs 对语言先验的依赖导致幻觉对象标记概率膨胀,从而加剧对象幻觉。为规避此问题,我们提出语言先验无验证(Language-Prior-Free Verification),使 LVLMs 能够忠实地验证对象存在的置信度。基于此,我们提出一种新颖的训练-free 自验证框架(Self-Validation Framework)来反击过度依赖陷阱。该框架首先验证样本候选描述中对象的存在性,进而通过描述选择或聚合来缓解对象幻觉。实验结果表明,我们的框架在图像描述任务中显著缓解了对象幻觉(例如在 LLaVA-v1.5-7B 上改进了 65.6% 的 CHAIRI 指标),超越了先前的 SOTA 方法。这一结果凸显了通过释放 LVLMs 自身潜在潜力以缓解幻觉的新路径。

关键词

引用

@article{arxiv.2601.22451,
  title  = {Countering the Over-Reliance Trap: Mitigating Object Hallucination for LVLMs via a Self-Validation Framework},
  author = {Shiyu Liu and Xinyi Wen and Zhibin Lan and Ante Wang and Jinsong Su},
  journal= {arXiv preprint arXiv:2601.22451},
  year   = {2026}
}

备注

Code is available at https://github.com/Liushiyu-0709/SelfVal