深层非线性网络中鞍点逃逸的理论
机器学习
2026-05-11 v2 无序系统与神经网络
机器学习
摘要
在小初始化的深层网络中,训练表现为由尖锐特征获取转变分隔开的长时间平坦期。尽管浅层非线性网络和深线性网络已被广泛研究,但将这些分析推广到深非线性网络仍具有挑战性。我们推导了一个精确恒等式,用于衡量各层权重矩阵 Frobenius 范数的不平衡,该恒等式适用于任意光滑激活函数和可微损失函数,并据此将激活函数分为四个普适类。在排列对称的子流形上,该恒等式结合近似平衡律,可将完整的矩阵流化简为一维 ODE,给出临界深度逃逸时间定律 τ_* = Θ(ε^{-(r-2)}),其中 r 是瓶颈尺度上的层数,而非总深度 L。我们发现,在r个瓶颈层按比例 ε 缩放后使用He正态初始化时,同样恢复了该r-2指数,尽管对称子流形在流动过程中被保持,但并非吸引。我们发现理论结果与数值仿真结果高度吻合。
引用
@article{arxiv.2605.01288,
title = {A Theory of Saddle Escape in Deep Nonlinear Networks},
author = {Divit Rawal and Michael R. DeWeese},
journal= {arXiv preprint arXiv:2605.01288},
year = {2026}
}