轻度过参数化的 ReLU 网络在正交数据上的递增学习与隐式偏置
机器学习
2026-05-27 v1 机器学习
摘要
神经网络的成功训练依赖于一阶优化方法,但这些方法的理论表征仍不完整。这在轻度过参数化设置下尤为如此。本文研究从小初始化开始的两层 ReLU 网络的梯度流动力学。我们证明当初始化规模趋于零时,极限流动收敛到一个 saddle-to-saddle 跳转过程,揭示了其中新增神经元在每个 saddle 处激活的递增学习现象。这一分析恢复了 Dana 等人(2025,arXiv:2502.16977)的已知结果:网络在 时(其中 为网络宽度, 为训练样本数)即可以高概率插值训练数据。这种递增过程表征还允许我们推导出一种新颖的隐式偏置结果:所学的插值器的平方 范数规模为 ,这在常数因子内接近最小 范数插值器。更广泛地说,我们的工作提供了 ReLU 网络递增学习过程的首个严格证明,同时表明轻度过参数化网络可收敛到其复杂度与最优插值器相同阶的插值解。
引用
@article{arxiv.2605.27097,
title = {Mildly Overparameterized ReLU Networks on Orthogonal Data: Incremental Learning and Implicit Bias},
author = {James Town and Etienne Boursier and Ben Lewis and Matthias Englert and Ranko Lazic},
journal= {arXiv preprint arXiv:2605.27097},
year = {2026}
}
备注
66 pages, 6 figures