中文

均质神经网络上(随机)亚梯度下降的后期训练动力学

机器学习 2025-07-18 v3 神经与进化计算 最优化与控制 机器学习

摘要

我们分析了常数步长随机亚梯度下降(SGD)的隐式偏好。我们考虑二分类问题中的均质神经网络设置——这类包含ReLU类激活函数(如无偏置的MLP和CNN)的深层神经网络的大类。我们将归一化SGD迭代的动力学解释为与归一化分类边际相关的保守场流的欧拉-like离散化。由于这种解释,我们表明在后期训练(即假设数据被正确分类且具有正归一化边际)时,归一化SGD迭代收敛于归一化边际临界点的集合。据我们了解,这是对Lyu和Li(2020)对梯度下降离散动力学分析的首次扩展,适用于非光滑和随机情形。我们的主要结果适用于以指数或逻辑损失进行的二分类。我们还讨论了对更一般设置的扩展。

关键词

引用

@article{arxiv.2502.05668,
  title  = {The late-stage training dynamics of (stochastic) subgradient descent on homogeneous neural networks},
  author = {Sholom Schechtman and Nicolas Schreuder},
  journal= {arXiv preprint arXiv:2502.05668},
  year   = {2025}
}

备注

Accepted/presented at the 38th Annual Conference on Learning Theory (COLT 2025)