LLM 是否真正了解自己不知道的东西?内部状态主要反映知识召回而非真实性
计算与语言
2026-04-20 v3
摘要
最近的研究表明,LLM 能“知道自己不知道”,认为幻觉输出与事实正确输出源于不同的内部过程,因而可通过内部信号加以区分。然而,幻觉的成因是多方面的:除了简单的知识缺口外,它们还可能源于训练激励,导致模型利用统计捷径或在预训练期间学习的虚假关联。本文认为,当 LLM 依赖此类学习关联来生成幻觉时,其内部过程与事实召回的机制相似,两者都源于模型参数中编码的强统计相关性。为验证这一观点,我们提出了一种新型分类法,将幻觉分为无关联幻觉(UHs)和关联幻觉(AHs),后者由虚假关联驱动。通过机制分析,我们比较了它们的计算过程与隐藏状态几何与事实正确输出的关系。我们的结果表明,隐藏状态主要反映模型是否召回参数知识,而非输出的真实性。因此,AHs 的隐藏状态几何与事实输出重合,使标准检测方法失效;相比之下,UHs 表现出独特且集中化的表示,便于可靠检测。
引用
@article{arxiv.2510.09033,
title = {Do LLMs Really Know What They Don't Know? Internal States Mainly Reflect Knowledge Recall Rather Than Truthfulness},
author = {Chi Seng Cheang and Hou Pong Chan and Wenxuan Zhang and Yang Deng},
journal= {arXiv preprint arXiv:2510.09033},
year = {2026}
}