中文

基于对比神经元引导的 LVLMs 可解释幻觉分析与缓解

计算机视觉与模式识别 2026-02-03 v1

摘要

大型视觉语言模型(LVLMs)在多模态理解与生成方面取得显著进展,但仍易产生幻觉。现有缓解方法主要关注输出层调整,未充分探索导致这些幻觉的内部机制。为深入理解,本文采用表征层视角,引入稀疏自编码器(SAEs)将稠密视觉嵌入分解为稀疏、可解释神经元。通过神经元级分析,我们识别出包括始终激活神经元和图像特定神经元等不同类型的神经元。我们的发现表明,幻觉往往源于图像特定神经元的干扰或虚假激活,而始终激活神经元保持相对稳定。此外, selectively 增强或抑制图像特定神经元可实现对 LVLM 输出的可控干预,提升视觉 grounding 并减少幻觉。基于这些洞见,我们提出对比神经元引导(CNS),通过对比干净输入和噪声输入之间的对比分析识别图像特定神经元。CNS 在放大信息性神经元的同时抑制扰动引起的激活,产生更稳健、语义上 grounded 的视觉表征。这种方法不仅提升视觉理解,还有效缓解幻觉。由于在填充阶段操作,CNS 与现有解码阶段方法完全兼容。在幻觉专注和通用多模态基准上的大规模实验表明,CNS 在保持整体多模态理解能力的同时持续减少幻觉。

关键词

引用

@article{arxiv.2602.00621,
  title  = {Towards Interpretable Hallucination Analysis and Mitigation in LVLMs via Contrastive Neuron Steering},
  author = {Guangtao Lyu and Xinyi Cheng and Qi Liu and Chenghao Xu and Jiexi Yan and Muli Yang and Fen Fang and Cheng Deng},
  journal= {arXiv preprint arXiv:2602.00621},
  year   = {2026}
}