通过自适应约束信息流缓解大型视觉语言模型中的幻觉
计算与语言
2025-03-03 v1
摘要
大型视觉语言模型在通过人类语言理解视觉信息方面展现出巨大潜力。然而,它们容易受到物体幻觉的影响,即生成的图像描述包含图像中不存在的物体。在本文中,我们揭示了物体幻觉可归因于当软视觉标记映射到 LLM 的词嵌入空间时,对不相关视觉特征的过度自信。具体而言,通过找出视觉标记与 LLM 词嵌入之间的语义相似性,我们观察到相似性分布的平滑度与物体幻觉的出现密切相关。为了缓解幻觉,我们提出使用变分信息瓶颈(VIB)通过引入随机噪声来缓解过度自信,从而促进对不相关信息的约束。此外,我们提出了一种基于熵的噪声控制策略,以使注入的噪声能够根据相似性分布的平滑度进行自适应约束。我们将所提出的 AdaVIB 适应于不同的模型架构。实验结果表明,所提出的 AdaVIB 通过有效缓解对不相关视觉特征的过度自信,减轻了物体幻觉,在两个物体幻觉基准上取得了一致的改进。
引用
@article{arxiv.2502.20750,
title = {Mitigating Hallucinations in Large Vision-Language Models by Adaptively Constraining Information Flow},
author = {Jiaqi Bai and Hongcheng Guo and Zhongyuan Peng and Jian Yang and Zhoujun Li and Mohan Li and Zhihong Tian},
journal= {arXiv preprint arXiv:2502.20750},
year = {2025}
}
备注
Accepted to AAAI 2025. Camera ready version