中文

多层神经网络的梯度下降泛化保证

机器学习 2025-07-22 v2 机器学习

摘要

近来,利用算法稳定性方法理解由梯度下降(GD)训练的神经网络(NNs)的泛化取得了显著进展。然而,现有研究大多聚焦于单隐藏层 NNs,且未涉及不同网络缩放参数的影响。在本文中,我们大幅扩展了先前工作 \cite{lei2022stability,richards2021stability},对多层 NNs 的 GD 进行了全面的稳定性和泛化分析。对于两层 NNs,我们的结果在一般网络缩放参数下建立,放宽了先前条件。在三层 NNs 情形下,我们的技术贡献在于利用一种新颖的归纳策略证明其近余强制(nearly co-coercive)性质,该策略深入探究了过参数化的影响。作为我们一般发现的直接应用,我们推导了两层和三层 NNs 中 GD 算法的 O(1/n)O(1/\sqrt{n}) 超额风险率。这阐明了由 GD 训练的参数不足和过参数化 NNs 达到期望风险率 O(1/n)O(1/\sqrt{n}) 的充分或必要条件。此外,我们证明随着缩放参数增大或网络复杂度降低,GD 达到期望错误率所需的过参数化更少。另外,在低噪声条件下,我们得到两层和三层 NNs 中 GD 的 O(1/n)O(1/n) 快速风险率。

关键词

引用

@article{arxiv.2305.16891,
  title  = {Generalization Guarantees of Gradient Descent for Multi-Layer Neural Networks},
  author = {Puyu Wang and Yunwen Lei and Di Wang and Yiming Ying and Ding-Xuan Zhou},
  journal= {arXiv preprint arXiv:2305.16891},
  year   = {2025}
}

备注

38 pages, 2 figures