非渐近优化与随机高斯-牛顿方法在过参数化模型中的泛化界限
机器学习
2025-11-13 v2 最优化与控制
机器学习
摘要
深度学习中重要问题之一是高阶优化方法如何影响泛化性能。本文分析了一种针对回归场景下具有光滑激活函数的过参数化深度神经网络的随机高斯-牛顿(SGN)方法,采用Levenberg-Marquardt阻尼和小批量采样进行训练。我们的理论贡献有二。首先,我们通过参数空间中的可变度量分析,建立了具有显式批大小、网络宽度和深度依赖性的有限时程收敛界限。其次,我们利用在过参数化 regime 下的统一稳定性,推导SGN的非渐近泛化界限,刻画了曲率、批大小和过参数化对泛化性能的影响。我们的理论结果识别出SGN在更有利的泛化 regime中:沿优化路径上高斯-牛顿矩阵的最小特征值越大,稳定性界限越紧密。
引用
@article{arxiv.2511.03972,
title = {Non-Asymptotic Optimization and Generalization Bounds for Stochastic Gauss-Newton in Overparameterized Models},
author = {Semih Cayci},
journal= {arXiv preprint arXiv:2511.03972},
year = {2025}
}