中文

两个通往真实性的路径:关于大语言模型幻觉内在编码的研究

计算与语言 2026-04-16 v2 人工智能

摘要

尽管大语言模型(LLM)展现了惊人的能力,但经常会生成幻觉。先前的研究表明,这些模型的内部状态编码了丰富的真实性信号,但这些信号的来源与机制仍不清晰。本文证明,真实性线索源自两个不同的信息路径:(1)依赖于问答信息流的“问题锚定”路径,以及(2)从生成答案本身派生自包含证据的“答案锚定”路径。首先,我们通过注意力掩盖和标记修补来验证并分离这些路径。随后,我们发现这些两种机制具有显著且有趣的属性。进一步的实验揭示:(1)这两种机制与LLM的知识边界密切相关;(2)内部表征能够意识到它们的区别。最后,基于这些启发性发现,我们提出了两个应用,以提升幻觉检测性能。总体而言,本工作为理解LLM如何内部编码真实性提供了新视角,为构建更可靠、更具自我意识的生成系统指明了方向。

关键词

引用

@article{arxiv.2601.07422,
  title  = {Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM Hallucinations},
  author = {Wen Luo and Guangyue Peng and Wei Li and Shaohang Wei and Feifan Song and Liang Wang and Nan Yang and Xingxing Zhang and Jing Jin and Furu Wei and Houfeng Wang},
  journal= {arXiv preprint arXiv:2601.07422},
  year   = {2026}
}

备注

Accepted to the ACL 2026 Main Conference