中文

结构刚性与57标记预测窗口:大型语言模型推理层可治理性的物理框架

人工智能 2026-04-07 v1

摘要

当前AI安全依赖于行为监控和后训练对齐,但经验测量表明,这些方法在测试的大多数指令调优模型中未产生可检测的预承诺信号。我们提出了一种能量基盟框架,将Transformer推理动力学连接到神经计算约束满足模型,并将其应用于跨五种几何 regime 的七模型组合。通过轨迹张力(ρ=||a||/||v||),我们在Phi-3-mini-4k-instruct在算术约束探针上的贪心解码下识别出57个标记的预承诺窗口。这一结果是模型特定的、任务特定的和配置特定的,表明预承诺信号可以存在但并非普遍。我们引入了推理行为的五种 regime 分类:权威带、迟信号、反向、平坦和Scaffold-选择。能量不对称(Σρ不匹配/Σρ匹配)作为结构刚性跨这些 regime 的统一度量。在七个模型中,仅有一个配置在承诺前显示预测信号;其他模型显示静默失败、迟检测、反向动力学或平坦几何。我们进一步展示,事实幻觉在72个测试条件下未产生预测信号,这与在缺乏训练世界模型约束时虚构引力吸收态的持久 settling 相符。这些结果表明,规则违反和幻觉是具有不同检测要求的不同失效模式。内部几何监控仅在存在阻力时才有效;检测事实性妄想需要外部验证机制。本工作提供了推理层可治理性的可度量框架,并为评估自主AI系统的部署风险引入了一套分类学。

关键词

引用

@article{arxiv.2604.03524,
  title  = {Structural Rigidity and the 57-Token Predictive Window: A Physical Framework for Inference-Layer Governability in Large Language Models},
  author = {Gregory M. Ruddell},
  journal= {arXiv preprint arXiv:2604.03524},
  year   = {2026}
}

备注

Extends arXiv:2603.21415. 30 pages. Also available on Zenodo (10.5281/zenodo.19393882)