中文

从认知心理学视角探究VLM幻觉:基于有趣观察的初步解释

计算机视觉与模式识别 2025-10-14 v2 计算与语言 机器学习

摘要

幻觉是视觉语言模型(VLM)中一个长期存在且被积极研究的问题。现有研究通常将幻觉归因于技术限制或谄媚偏差,后者指模型倾向于生成错误答案以符合用户期望。然而,这些解释主要关注技术或外部驱动因素,可能忽略了幻觉行为可能反映人类心理学中观察到的认知偏差。在这项工作中,我们引入了一种心理学分类法,对导致幻觉的VLM认知偏差进行分类,包括谄媚、逻辑不一致,以及新识别的VLM行为:诉诸权威。为了系统分析这些行为,我们设计了AIpsych,一个可扩展的基准测试,用于揭示模型响应模式中的心理倾向。利用该基准,我们研究了模型架构和参数大小的变化如何影响模型在回答经过策略性操纵的问题时的行为。我们的实验表明,随着模型规模增大,VLM表现出更强的谄媚倾向,但权威偏差减少,这表明能力提升但响应完整性可能受损。一项人类受试者研究进一步验证了我们的假设,并突出了VLM与人类受访者之间的关键行为差异。这项工作为理解VLM中的幻觉提供了新视角,并强调了将心理学原理融入模型评估的重要性。

关键词

引用

@article{arxiv.2507.03123,
  title  = {Investigating VLM Hallucination from a Cognitive Psychology Perspective: A First Step Toward Interpretation with Intriguing Observations},
  author = {Xiangrui Liu and Man Luo and Agneet Chatterjee and Hua Wei and Chitta Baral and Yezhou Yang},
  journal= {arXiv preprint arXiv:2507.03123},
  year   = {2025}
}