中文

Transformer记忆的吸引子几何:从冲突仲裁到自信幻觉

人工智能 2026-05-15 v2

摘要

语言模型依赖两种知识来源:烘焙进权重的事实(参数记忆,PM)和上下文中的信息(工作记忆,WM)。我们研究了两种机制上不同的失败模式——冲突,即PM和WM不一致并相互干扰;以及幻觉,即查询的事实从未被学习过。两者无论如何都会产生自信的输出,使得基于输出的监控在设计上就是盲目的。我们展示了这两种失败共享一个统一的几何解释。在自回归生成的隐藏状态空间中,学习到的事实形成吸引子盆地。冲突是盆地竞争:WM阻止收敛到正确的盆地而不提高输出熵。幻觉是盆地缺失:当没有记忆的盆地存在时,隐藏状态自由漂移。为下一词预测设计的冻结LM头无法区分这些情况,并在任何一种情况下都自信地触发。我们在一个受控的合成任务中验证了这一解释——实体标识符映射到唯一代码,PM通过LoRA适配器安装——其中真实值是精确的,组件角色可以通过有针对性的适配器放置进行因果隔离。几何间隔——隐藏状态到最近记忆盆地的距离——直接读取这种几何结构,并将正确召回与幻觉区分开来,其清晰度远高于输出熵,在基于熵的检测无法避免拒绝绝大多数正确输出的情况下,实现了零错误拒绝。这种区分在预训练模型对自然语言事实查询上成立,无需任何适配,证实了吸引子几何是结构性的,而非微调产物。自信幻觉的比例遵循标度律C=exp(c/Δˉ)C = \exp(-c/\bar\Delta),随着规模增长而增加,即使整体错误率下降。隐藏状态可靠地编码认知状态;冻结的输出头系统地擦除它——并且这种擦除随着规模扩大而恶化。

关键词

引用

@article{arxiv.2605.05686,
  title  = {Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination},
  author = {Qiyao Liang and Risto Miikkulainen and Ila Fiete},
  journal= {arXiv preprint arXiv:2605.05686},
  year   = {2026}
}

备注

9 pages, 6 figures, plus appendices