中文

幻觉作为轨迹承诺:变形器生成中非对称吸引子动力学的因果证据

机器学习 2026-04-20 v1 人工智能 计算与语言

摘要

我们提出了自回归语言模型中幻觉是由早期轨迹承诺主导的非对称吸引子动力学的因果证据。通过相同提示的分叉实验,即重复采样相同的输入以观察自发分支,我们隔离了轨迹动力学,排除了提示级别的混杂因素。在 Qwen2.5-1.5B 模型上进行 61 个提示的测试,覆盖六个类别,27 个提示(44.3%)在第一个生成标记时发生分支,事实轨迹和幻觉轨迹在第 0 步时 KL 散度为 0,在第 1 步时 KL > 1.0。通过激活修补实验发现,显著的因果非对称性:将幻觉激活注入正确轨迹会在 87.5% 的试验中损坏输出(第 20 层),而相反的恢复只有 33.3%(第 24 层);两者均显著高于 10.4% 的基线(p = 0.025)和 12.5% 的随机修补控制。窗口修补显示,纠正需要持续的多步骤干预,而损坏只需单个扰动。探讨提示编码本身,步骤 0 的残差状态在第 15 层预测每提示的幻觉率的皮尔逊相关系数为 r = 0.776(p < 0.001,针对 1000 次随机置换的零假设);无监督聚类识别出五个类似于 regime 的组(eta^2 = 0.55),其中 saddle-adjacent 聚类集中了 12 个 13 个分叉的虚假前提提示中 12 个,表明该流形结构是围绕在提示编码时固定的 regime 承诺组织的。这些发现将幻觉表征为局部稳定的吸引子池:进入是概率性的和快速的,退出需要跨层和跨步骤的协调干预,相关的吸引子池由在第 0 步即可辨识的可聚类 regime 所选择。

关键词

引用

@article{arxiv.2604.15400,
  title  = {Hallucination as Trajectory Commitment: Causal Evidence for Asymmetric Attractor Dynamics in Transformer Generation},
  author = {G. Aytug Akarlar},
  journal= {arXiv preprint arXiv:2604.15400},
  year   = {2026}
}

备注

21 pages, 12 figures, 8 tables. Code and data: https://github.com/akarlaraytu/trajectory-commitment