中文

谱边动力学:神经网络训练中相变的分析-实证研究

机器学习 2026-05-08 v3 人工智能

摘要

我们发展了谱边分析:神经网络训练中的相变——grokking、能力增益、损失平台——由参数更新的滑动窗口 Gram 矩阵的谱间隙所控制。在极端宽高比区域(参数 P108P \sim 10^8,窗口 W10W \sim 10),经典的 BBP 检测阈值是空洞的;起作用的结构是将主导模式与次主导模式在位置 k=argmaxσj/σj+1k^* = \mathrm{argmax}\, \sigma_j/\sigma_{j+1} 处隔开的信号内间隙。从三个假设我们推导出:(i) 由 Dyson 型 ODE 控制的间隙动力学,具有曲率不对称性、阻尼和梯度驱动;(ii) 一个谱损失分解,将每个模式的学习贡献与其 Davis–Kahan 稳定性系数联系起来;(iii) 间隙最大化原理,表明 kk^* 是唯一的动力学特权位置——其崩溃是唯一会破坏学习的事件,并且它通过一个 α\alpha 反馈环维持自身,该环对优化器不做假设。绝热参数 A=ΔGF/(ηg2)\mathcal{A} = \|\Delta G\|_F / (\eta\, g^2) 控制回路稳定性:A1\mathcal{A} \ll 1(平台),A1\mathcal{A} \sim 1(相变),A1\mathcal{A} \gg 1(遗忘)。在六个模型族(150K–124M 参数)上验证:间隙动力学先于每次 grokking 事件出现(24/24 次含权重衰减,1/24 次不含),间隙位置依赖于优化器(Muon: k=1k^*=1,AdamW: k=2k^*=2 在同一模型上),19/20 个定量预测得到确认。该框架与稳定边缘、Tensor Programs、Dyson 布朗运动、彩票假设和神经缩放定律一致。

关键词

引用

@article{arxiv.2603.28964,
  title  = {Spectral Edge Dynamics: An Analytical-Empirical Study of Phase Transitions in Neural Network Training},
  author = {Yongzhong Xu},
  journal= {arXiv preprint arXiv:2603.28964},
  year   = {2026}
}

备注

63 pages, 5 figures