均质神经网络上(随机)亚梯度下降的后期训练动力学
机器学习
2025-07-18 v3 神经与进化计算
最优化与控制
机器学习
摘要
我们分析了常数步长随机亚梯度下降(SGD)的隐式偏好。我们考虑二分类问题中的均质神经网络设置——这类包含ReLU类激活函数(如无偏置的MLP和CNN)的深层神经网络的大类。我们将归一化SGD迭代的动力学解释为与归一化分类边际相关的保守场流的欧拉-like离散化。由于这种解释,我们表明在后期训练(即假设数据被正确分类且具有正归一化边际)时,归一化SGD迭代收敛于归一化边际临界点的集合。据我们了解,这是对Lyu和Li(2020)对梯度下降离散动力学分析的首次扩展,适用于非光滑和随机情形。我们的主要结果适用于以指数或逻辑损失进行的二分类。我们还讨论了对更一般设置的扩展。
引用
@article{arxiv.2502.05668,
title = {The late-stage training dynamics of (stochastic) subgradient descent on homogeneous neural networks},
author = {Sholom Schechtman and Nicolas Schreuder},
journal= {arXiv preprint arXiv:2502.05668},
year = {2025}
}
备注
Accepted/presented at the 38th Annual Conference on Learning Theory (COLT 2025)