中文

均匀神经网络中随机梯度下降的广义界限

机器学习 2026-02-27 v1

摘要

算法稳定性是广义性分析中最强大的技术之一。然而,其推导通常需要在非凸训练环境下采用步长 ηt=O(1/t)\eta_t = \mathcal{O}(1/t) 的衰减方式,其中 tt 表示迭代次数。这种僵化的步长衰减可能阻碍优化,并可能不符合实际场景。在本文中,我们在均匀神经网络 regime 下推导广义界限,证明该 regime 允许步长以 Ω(1/t)\Omega(1/\sqrt{t}) 的较慢衰减率,且在温和假设下成立。我们进一步从多个方面扩展了理论结果,例如非 Lipschitz 场景。该发现具有广泛适用性,因为均匀神经网络涵盖了采用 ReLU 和 LeakyReLU 激活函数的全连接神经网络和卷积神经网络。

关键词

引用

@article{arxiv.2602.22936,
  title  = {Generalization Bounds of Stochastic Gradient Descent in Homogeneous Neural Networks},
  author = {Wenquan Ma and Yang Sui and Jiaye Teng and Bohan Wang and Jing Xu and Jingqin Yang},
  journal= {arXiv preprint arXiv:2602.22936},
  year   = {2026}
}