中文

大型语言模型中潜在状态持久性失效的实验研究

计算与语言 2026-01-27 v5 人工智能

摘要

尽管大型语言模型(LLM)在推理方面表现出色,但它们是否能够维持持久的潜在状态仍未得到充分探索。能够保持和操作未公开的内部表示——类似于人类工作记忆——是复杂推理的基石。在本文中,我们通过三个新实验来正式化和量化“潜在状态持久性”(LSP)间隙。首先,我们利用数字猜谜游戏,表明在独立查询之间,LLM 未能为单一隐藏选择分配概率质量,违反了基本概率原理。其次,我们采用是-否游戏,表明随着问题数量的增加,LLM 存在“概念漂移”,由于缺乏 LSP,导致不可避免的自相矛盾。最后,灵感来自数学心灵主义,我们让模型跟踪隐藏变量上的变换,揭示了在初始状态未显式出现在上下文中的情况下,变量绑定和状态演化的失败。总体而言,这些发现表明 LLM 作为反事后求解器运作,而非具有 LSP 的主动规划器。我们的工作提供了评估内部表示忠诚度的框架,突显了自回归 Transformer 与类人认知之间根本性的架构差异。

关键词

引用

@article{arxiv.2505.10571,
  title  = {On the Failure of Latent State Persistence in Large Language Models},
  author = {Jen-tse Huang and Kaiser Sun and Wenxuan Wang and Mark Dredze},
  journal= {arXiv preprint arXiv:2505.10571},
  year   = {2026}
}

备注

8 pages, 6 figures, 9 tables