通过大步幅和自适应步长的梯度下降在逻辑回归中的最小混合界收敛
机器学习
2025-04-21 v2 机器学习
摘要
我们研究了用于线性可分数据上的逻辑回归的梯度下降(GD)方法,其步长随当前风险自适应调整,并缩放由常数超参数 控制。我们证明,在最多 步的预热步骤后,GD 的风险上界为 ,其中 为数据集的边际。由于 可任意增大,GD 在预热步骤后即可实现任意小的风险,尽管风险演化可能呈非单调。我们进一步构造边际为 的困难数据集,其中任何批量(或在线)一阶方法都需要 步才能找到线性分离超平面。因此,GD 采用大步幅和自适应步长在一阶批量方法中达到了最小混合界最优性。值得注意的是,经典的感知机(Perceptron,Novikoff,1962)——一种一阶在线方法——也实现了 的步数复杂度,与 GD 在常数项上一致。最后,我们的 GD 分析推广到广泛的损失函数和某些两层网络。
引用
@article{arxiv.2504.04105,
title = {Minimax Optimal Convergence of Gradient Descent in Logistic Regression via Large and Adaptive Stepsizes},
author = {Ruiqi Zhang and Jingfeng Wu and Licong Lin and Peter L. Bartlett},
journal= {arXiv preprint arXiv:2504.04105},
year = {2025}
}
备注
28 pages