中文

梯度下降中早停对过参数化逻辑回归的益处

机器学习 2025-07-01 v2 机器学习

摘要

在过参数化逻辑回归中,梯度下降(GD)的迭代在范数上发散,但在方向上收敛于最大 2\ell_2-间隔解——这一现象被称为 GD 的隐式偏差。本研究探讨了在良设高维逻辑回归中,由早停引起的额外正则化效应。我们首先证明,对于早停的 GD,过剩逻辑风险消失,但对于收敛时的 GD 迭代,过剩逻辑风险发散至无穷大。这表明早停的 GD 是校准良好的,而渐近 GD 在统计上是不一致的。其次,我们表明,要获得较小的过剩 0-1 风险,早停的 GD 只需多项式级数量的样本即可,而对于任何插值估计器(包括渐近 GD),则需要指数级数量的样本。这种分离凸显了在过参数化机制下早停的统计益处。最后,我们建立了早停 GD 与 2\ell_2-正则化经验风险最小化器之间范数和角度差异的非渐近界限,从而将 GD 的隐式正则化与显式 2\ell_2-正则化联系起来。

关键词

引用

@article{arxiv.2502.13283,
  title  = {Benefits of Early Stopping in Gradient Descent for Overparameterized Logistic Regression},
  author = {Jingfeng Wu and Peter Bartlett and Matus Telgarsky and Bin Yu},
  journal= {arXiv preprint arXiv:2502.13283},
  year   = {2025}
}

备注

ICML 2025 Camera Ready