暴露幻觉以抑制幻觉:基于生成锚点的VLM表示编辑
计算机视觉与模式识别
2025-09-29 v1
摘要
多模态大语言模型(MLLM)在多样化的视觉语言任务中取得了显著的进展,但仍高度依赖于幻觉,产生内容虽流畅却不符合视觉证据。这种幻觉涵盖对象、属性和关系,即使在更大模型中也难以消除,而现有的缓解方法通常需要额外的微调、手工先验,或在信息性和可扩展性之间做出权衡。为此,我们提出一种无需训练的、自监督的方法,用于幻觉缓解。我们引入一种新的幻觉放大机制:将说明文本通过文本到图像模型投射到视觉空间,以揭示隐式幻觉信号,作为负锚点,而原始图像则提供正锚点。利用这两个锚点,我们通过将表示引向忠实语义并远离幻觉方向来编辑解码器隐藏状态。这一纠正无需人类先验或额外训练成本,确保了有效性和效率。广泛的实验表明,该方法在对象、属性和关系层面显著减少幻觉,同时基本保留召回率和说明丰富度,例如在CHAIR基准上使用LLaVA-v1.5-7B即可实现超过5%的幻觉降低。此外,针对不同架构(包括LLaVA-NEXT-7B、Cambrian-8B和InstructBLIP-7B)的实验结果表明其具有强大的跨架构泛化能力。更重要的是,当应用于幻觉自由的说明时,本方法几乎不会引入副作用,凸显了其鲁棒性和实际的即插即用适用性。该实现将公开发布。
引用
@article{arxiv.2509.21997,
title = {Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors},
author = {Youxu Shi and Suorong Yang and Dong Liu},
journal= {arXiv preprint arXiv:2509.21997},
year = {2025}
}