神经网络需要梯度下降来泛化吗?一项理论研究
机器学习
2025-12-19 v2 机器学习
摘要
传统观点将过参数化神经网络的神秘泛化能力归因于梯度下降(及其变体)。最近的体积假说挑战了这一观点:它认为即使将梯度下降替换为Guess & Check(G&C),即通过抽取权重设置直到找到拟合训练数据的设置,这些泛化能力仍然存在。体积假说对宽和深神经网络的有效性仍然是一个开放问题。在本文中,我们在理论上研究了这一问题,针对矩阵分解(具有线性和非线性激活)——神经网络理论中的常见测试平台。我们首先证明G&C下的泛化能力随宽度增加而恶化,建立了我们所知的首个G&C被证明劣于梯度下降的案例。反之,我们证明G&C下的泛化能力随深度增加而提高,揭示了宽网络与深网络之间的鲜明对比,我们进一步通过实证验证了这些发现。这些结果表明,即使在简单设置下,关于神经网络是否需要梯度下降来良好泛化的问题也可能没有简单的答案。
引用
@article{arxiv.2506.03931,
title = {Do Neural Networks Need Gradient Descent to Generalize? A Theoretical Study},
author = {Yotam Alexander and Yonatan Slutzky and Yuval Ran-Milo and Nadav Cohen},
journal= {arXiv preprint arXiv:2506.03931},
year = {2025}
}
备注
Accepted to NeurIPS 2025