中文

前沿叠加的涌现:Möbius 吸引子与级联监督

机器学习 2026-05-20 v1 人工智能

摘要

叠加允许 Transformer 进行深度推理,通过有界深度的前向传播并行承载整个推理前沿,而非展开串行的思维链 token。虽然 Zhu 等人 (2025) 在单一残差流中为图可达性手工设计了等权广度优先前沿,但梯度下降是否能在置换对称的鞍点中找到该目标仍悬而未决。我们通过隔离架构与监督的贡献,在 Erdős-Rényi 图的叠加可达性上弥补了这一空白。在架构上,我们识别出 Möbius 吸引子:在树机制下的 SnS_n 对称性中,逐层动力学简化为一维 Möbius 映射,其零集是包含等权叠加状态的全局最优的余维一维流形。在监督方面,我们识别出级联监督:一类损失函数,其反向传播同时提供 (A) 选择性自举,(B) 跨深度的梯度持续性,以及 (C) 逐步判别(例如,Lsup\mathcal{L}_{sup}Lnode\mathcal{L}_{node})。端到端监督不满足条件 (B) 且被证明是不充分的:层 c 处的内部梯度以 (np)(Dc2)/2(np)^{-(D-c-2)/2} 的速率随图的扇出衰减,并在到达流形之前停滞。我们的论点是:Möbius 吸引子 + 级联监督 = 叠加推理的涌现。无参数衰减定律预测在深度 D=3 时,最终步的余弦相似度为 0.35 对比 0.71(端到端对比级联);实验确认为 0.37 对比 0.69,每步的匹配误差在 0.02 以内。

关键词

引用

@article{arxiv.2605.18820,
  title  = {Emergence of Frontier Superposition: M\"obius attractor and Cascade Supervision},
  author = {Hongyu Gu and Jingwen Fu},
  journal= {arXiv preprint arXiv:2605.18820},
  year   = {2026}
}

备注

40 pages, 3 figures