中文

关于广义损失下双层线性神经网络的梯度下降的局部Polyak-Lojasiewicz条件与下降引理

机器学习 2025-05-20 v1 最优化与控制 机器学习

摘要

大多数关于过参数化神经网络梯度下降(GD)收敛性的工作都依赖对步长(无穷小)、隐藏层宽度(无穷大)或初始化(大、谱、平衡)的强假设。最近的努力试图放宽这些假设,主要聚焦于使用平方损失训练的两层线性网络。在本工作中,我们在放宽步长、宽度和初始化的假设下,推导了在广义损失下训练两层线性神经网络的梯度下降的线性收敛率。这一结果的一个关键挑战是:诸如Polyak-{\L}ojasiewicz(PL)条件和下降引理等用于推导非凸问题收敛性的经典工具,对过参数化神经网络并不在全局范围内成立。我们在此证明,这两个条件在局部成立,其局部常数随权重而变化。然后,我们给出这些局部常数的上界,这些上界取决于权重的初始化、当前损失以及非过参数化模型的全局PL和光滑常数。基于这些上界,我们推导出GD的线性收敛率。我们的收敛分析不仅改进了先前的结果,也建议一种更好的步长选择,经过数值实验验证。

关键词

引用

@article{arxiv.2505.11664,
  title  = {A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models},
  author = {Ziqing Xu and Hancheng Min and Salma Tarmoun and Enrique Mallada and Rene Vidal},
  journal= {arXiv preprint arXiv:2505.11664},
  year   = {2025}
}