中文

语言模型的事实自我感知:表示、鲁棒性与缩放

计算与语言 2025-05-28 v1 人工智能 机器学习

摘要

生成内容中的事实错误是大语言模型(LLM)广泛部署面临的主要问题之一。先前的研究表明,LLM(有时)能够检测其生成内容中的事实错误(即生成后事实核查)。在本工作中,我们提供了证据支持 LLM 内部存在一种指南针,在生成时即决定了事实召回的正确性。我们证明,对于给定的主实体和关系,LLM 在 Transformer 的残差流中内部编码了线性特征,这些特征决定了它是否能够召回正确的属性(从而构成有效的实体-关系-属性三元组)。这种自我感知信号对微小的格式变化具有鲁棒性。我们通过不同的示例选择策略研究了上下文扰动的影响。跨模型规模和训练动态的缩放实验表明,这种自我感知在训练过程中迅速出现,并在中间层达到峰值。这些发现揭示了 LLM 内在的自我监控能力,有助于提升其可解释性与可靠性。

关键词

引用

@article{arxiv.2505.21399,
  title  = {Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling},
  author = {Hovhannes Tamoyan and Subhabrata Dutta and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2505.21399},
  year   = {2025}
}