中文

模型在想什么?通过模型内部状态分析理解大型语言模型幻觉的“心理学”

计算与语言 2025-02-20 v1 人工智能

摘要

大型语言模型(LLM)系统受限于模型生成有效且符合事实内容的不稳定能力,从而导致幻觉的产生。当前的幻觉检测方法严重依赖模型外部的信息源,例如使用 RAG 辅助检测,从而带来沉重的额外延迟。最近,LLM 推理的内部状态已被广泛应用于大量研究工作中,如提示注入检测等。考虑到 LLM 内部状态的可解释性以及它们不需要外部信息源的事实,我们将这种状态引入到 LLM 幻觉检测中。在本文中,我们系统分析了推理前向传播过程中不同内部状态所揭示的特征,并全面评估了它们在幻觉检测中的能力。具体而言,我们将大型语言模型的前向过程分为三个阶段:理解、查询、生成,并从这些阶段中提取内部状态。通过分析这些状态,我们深入理解了为什么会生成幻觉内容以及模型内部状态中发生了什么。然后,我们将这些内部状态引入到幻觉检测中,并进行综合实验以讨论其优势与局限性。

关键词

引用

@article{arxiv.2502.13490,
  title  = {What are Models Thinking about? Understanding Large Language Model Hallucinations "Psychology" through Model Inner State Analysis},
  author = {Peiran Wang and Yang Liu and Yunfei Lu and Jue Hong and Ye Wu},
  journal= {arXiv preprint arXiv:2502.13490},
  year   = {2025}
}