中文

大语言模型能否预测自身错误?基于内部电路的自我意识

计算与语言 2026-01-06 v2

摘要

大语言模型(LLMs)生成流畅且复杂的输出,但常常无法识别自身的错误和幻觉。现有方法通常依赖外部评判器、多样本一致性或基于文本的自我批判,这些方法会增加额外计算开销或与真实正确性相关性较弱。我们提出:大语言模型能否通过在推理期间检查内部状态来预测自身错误?我们引入Gnosis,一种轻量级的自我意识机制,使冻结的LLMs能够通过解码隐藏状态和注意力模式中的信号,执行内在自我验证。Gnosis被动观察内部痕迹,将其压缩为固定预算描述符,并以极低的推理成本预测正确性,仅需约500万参数,且独立于序列长度。在数学推理、开放域问答和学术知识基准测试中,以及在1.7B至20B参数的冻结主干模型上,Gnosis在准确率和校准方面 consistently 优于强大的内部基线和大型外部评判器。此外,它零样本地 generalizes 到部分生成,使能够早期检测失败轨迹并进行计算感知的控制。这些结果表明,可靠的正确性线索是内在于生成过程中的,并且可以在无外部监督的情况下高效提取。

关键词

引用

@article{arxiv.2512.20578,
  title  = {Can LLMs Predict Their Own Failures? Self-Awareness via Internal Circuits},
  author = {Amirhosein Ghasemabadi and Di Niu},
  journal= {arXiv preprint arXiv:2512.20578},
  year   = {2026}
}