谱边动力学:神经网络训练中相变的分析-实证研究
机器学习
2026-05-08 v3 人工智能
摘要
我们发展了谱边分析:神经网络训练中的相变——grokking、能力增益、损失平台——由参数更新的滑动窗口 Gram 矩阵的谱间隙所控制。在极端宽高比区域(参数 ,窗口 ),经典的 BBP 检测阈值是空洞的;起作用的结构是将主导模式与次主导模式在位置 处隔开的信号内间隙。从三个假设我们推导出:(i) 由 Dyson 型 ODE 控制的间隙动力学,具有曲率不对称性、阻尼和梯度驱动;(ii) 一个谱损失分解,将每个模式的学习贡献与其 Davis–Kahan 稳定性系数联系起来;(iii) 间隙最大化原理,表明 是唯一的动力学特权位置——其崩溃是唯一会破坏学习的事件,并且它通过一个 反馈环维持自身,该环对优化器不做假设。绝热参数 控制回路稳定性:(平台),(相变),(遗忘)。在六个模型族(150K–124M 参数)上验证:间隙动力学先于每次 grokking 事件出现(24/24 次含权重衰减,1/24 次不含),间隙位置依赖于优化器(Muon: ,AdamW: 在同一模型上),19/20 个定量预测得到确认。该框架与稳定边缘、Tensor Programs、Dyson 布朗运动、彩票假设和神经缩放定律一致。
引用
@article{arxiv.2603.28964,
title = {Spectral Edge Dynamics: An Analytical-Empirical Study of Phase Transitions in Neural Network Training},
author = {Yongzhong Xu},
journal= {arXiv preprint arXiv:2603.28964},
year = {2026}
}
备注
63 pages, 5 figures