稳定性边缘下逻辑回归梯度下降的隐式偏置
机器学习
2023-10-17 v2 机器学习
摘要
近期研究观察到,在机器学习优化中,梯度下降(GD)常在稳定性边缘(EoS)[Cohen 等, 2021] 运行,其中步长设为较大值,导致 GD 迭代引发非单调损失。本文研究在 EoS regime 下,常步长 GD 对线性可分数据上逻辑回归的收敛性与隐式偏置。尽管存在局部振荡,我们证明逻辑损失可由 GD 以\emph{任意}常步长在长时间尺度上最小化。进一步,我们证明以\emph{任意}常步长,GD 迭代在投影至最大间隔方向(硬间隔 SVM 方向)时趋于无穷,并在投影至最大间隔方向的正交补时收敛于最小化强凸势的固定向量。作为对比,我们还表明在 EoS regime 下,GD 迭代在指数损失下可能灾难性发散,凸显逻辑损失的优越性。这些理论发现与数值模拟一致,并补充了现有关于 GD 对逻辑回归收敛性与隐式偏置的理论——那些理论仅适用于步长足够小的情形。
引用
@article{arxiv.2305.11788,
title = {Implicit Bias of Gradient Descent for Logistic Regression at the Edge of Stability},
author = {Jingfeng Wu and Vladimir Braverman and Jason D. Lee},
journal= {arXiv preprint arXiv:2305.11788},
year = {2023}
}
备注
NeurIPS 2023 camera ready version