视觉语言模型中提示诱导幻觉的机制
计算机视觉与模式识别
2026-04-20 v2 人工智能
计算与语言
摘要
大型视觉语言模型(VLM) 具有很强的能力,但往往因偏重文本提示而忽视视觉证据产生幻觉。我们在受控的物体计数设置中研究了这种失败模式,其中提示夸大了图像中物体的数量(例如,当只有三朵睡莲时,要求模型描述四朵)。在物体数量较少时,模型通常会纠正这种过估,但随着物体数量的增加,无论差异如何,模型越来越倾向于遵从提示。通过对三个 VLM 的机制分析,我们发现了一小部分注意力头,消融这些注意力头可使提示诱导幻觉(PIH) 至少减少 40%,且无需额外训练。在不同模型中,PIH 头以模型特定的方式介导提示复制。我们表征了这些差异,并表明 PIH 消融增加了向视觉证据的纠正。我们的发现为驱动提示诱导幻觉的内部机制提供了见解,揭示了这些行为在实现方式上的模型特定差异。
引用
@article{arxiv.2601.05201,
title = {Mechanisms of Prompt-Induced Hallucination in Vision-Language Models},
author = {William Rudman and Michal Golovanevsky and Dana Arad and Yonatan Belinkov and Ritambhara Singh and Carsten Eickhoff and Kyle Mahowald},
journal= {arXiv preprint arXiv:2601.05201},
year = {2026}
}
备注
ACL 2026 Main