梯度下降中早停对过参数化逻辑回归的益处
机器学习
2025-07-01 v2 机器学习
摘要
在过参数化逻辑回归中,梯度下降(GD)的迭代在范数上发散,但在方向上收敛于最大 -间隔解——这一现象被称为 GD 的隐式偏差。本研究探讨了在良设高维逻辑回归中,由早停引起的额外正则化效应。我们首先证明,对于早停的 GD,过剩逻辑风险消失,但对于收敛时的 GD 迭代,过剩逻辑风险发散至无穷大。这表明早停的 GD 是校准良好的,而渐近 GD 在统计上是不一致的。其次,我们表明,要获得较小的过剩 0-1 风险,早停的 GD 只需多项式级数量的样本即可,而对于任何插值估计器(包括渐近 GD),则需要指数级数量的样本。这种分离凸显了在过参数化机制下早停的统计益处。最后,我们建立了早停 GD 与 -正则化经验风险最小化器之间范数和角度差异的非渐近界限,从而将 GD 的隐式正则化与显式 -正则化联系起来。
引用
@article{arxiv.2502.13283,
title = {Benefits of Early Stopping in Gradient Descent for Overparameterized Logistic Regression},
author = {Jingfeng Wu and Peter Bartlett and Matus Telgarsky and Bin Yu},
journal= {arXiv preprint arXiv:2502.13283},
year = {2025}
}
备注
ICML 2025 Camera Ready