中文

变换器如何拒绝错误答案:事实约束处理的旋转动力学

计算与语言 2026-03-17 v1 人工智能

摘要

当语言模型接收到错误答案时,网络内部发生了什么?当前理解将真实性视为单层表示的静态属性——一个待探测的方向,一个待提取的特征。但对其动力学机制知之甚少:模型在处理正确与错误延续时,内部表示在整个网络深度上如何发散。我们提出强制补全探测,一种方法,该方法使用已知的正确和错误单token延续来呈现相同查询,并在四个仅解码器模型(1.5B-13B参数)的每一层追踪五种几何测量。我们报告了三项发现。第一,正确与错误路径通过旋转而非重缩放而发散:位移向量保持近似相同的大小,而其角度分离增大,意味着事实在近似超球面上的方向中被编码。第二,模型在错误输入上并非被动失败——它主动抑制正确答案,将内部概率驱离正确token。第三,两种现象在参数阈值以下完全不存在,并在1.6B参数处出现,表明事实处理能力存在相变。这些结果表明事实约束处理具有特定的几何特征——旋转的而非标量的;主动的而非被动的——这些特征对基于单层探测或幅度比较的方法是不可见的。

关键词

引用

@article{arxiv.2603.13259,
  title  = {How Transformers Reject Wrong Answers: Rotational Dynamics of Factual Constraint Processing},
  author = {Javier Marín},
  journal= {arXiv preprint arXiv:2603.13259},
  year   = {2026}
}