多层神经网络的梯度下降泛化保证
机器学习
2025-07-22 v2 机器学习
摘要
近来,利用算法稳定性方法理解由梯度下降(GD)训练的神经网络(NNs)的泛化取得了显著进展。然而,现有研究大多聚焦于单隐藏层 NNs,且未涉及不同网络缩放参数的影响。在本文中,我们大幅扩展了先前工作 \cite{lei2022stability,richards2021stability},对多层 NNs 的 GD 进行了全面的稳定性和泛化分析。对于两层 NNs,我们的结果在一般网络缩放参数下建立,放宽了先前条件。在三层 NNs 情形下,我们的技术贡献在于利用一种新颖的归纳策略证明其近余强制(nearly co-coercive)性质,该策略深入探究了过参数化的影响。作为我们一般发现的直接应用,我们推导了两层和三层 NNs 中 GD 算法的 超额风险率。这阐明了由 GD 训练的参数不足和过参数化 NNs 达到期望风险率 的充分或必要条件。此外,我们证明随着缩放参数增大或网络复杂度降低,GD 达到期望错误率所需的过参数化更少。另外,在低噪声条件下,我们得到两层和三层 NNs 中 GD 的 快速风险率。
引用
@article{arxiv.2305.16891,
title = {Generalization Guarantees of Gradient Descent for Multi-Layer Neural Networks},
author = {Puyu Wang and Yunwen Lei and Di Wang and Yiming Ying and Ding-Xuan Zhou},
journal= {arXiv preprint arXiv:2305.16891},
year = {2025}
}
备注
38 pages, 2 figures