中文

当提示词覆盖视觉:LVLMs 中的提示诱导幻觉

计算机视觉与模式识别 2026-04-24 v1 人工智能 计算与语言 机器学习

摘要

尽管大型视觉语言模型(LVLMs)在能力方面取得了显著进展,但这些系统仍然对幻觉(即不以视觉输入为依据的输出)高度脆弱。先前的工作将 LVLMs 中的幻觉归因于视觉 backbone 的局限性或语言组件的支配地位,但不同因素的相对重要性尚不明确。为解决这一模糊不清之处,我们提出 HalluScope,一个更好理解不同因素如何诱导幻觉的 benchmark。我们的分析表明,幻觉主要源于对文本先验和背景知识的过度依赖,特别是通过文本指令引入的信息。为缓解由文本指令先验诱导的幻觉,我们提出 HalluVL-DPO,一个针对可视语言模型进行微调以更加以视觉为依据的响应框架。HalluVL-DPO 利用我们构建的筛选训练数据集,利用偏好优化,引导模型倾向于选择以 grounded responses 而非幻觉 responses。我们展示,我们优化的模型有效缓解了该目标幻觉失效模式,同时在其他幻觉基准测试和视觉能力评估中保持或提升性能。为支持可重复性和进一步研究,我们将公开发布我们的评估基准、偏好训练数据集和代码。

关键词

引用

@article{arxiv.2604.21911,
  title  = {When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs},
  author = {Pegah Khayatan and Jayneel Parekh and Arnaud Dapogny and Mustafa Shukor and Alasdair Newson and Matthieu Cord},
  journal= {arXiv preprint arXiv:2604.21911},
  year   = {2026}
}