大步长下逻辑回归的梯度下降在不可分离数据上的行为
机器学习
2024-11-05 v2 最优化与控制
摘要
我们研究在大常数步长下的逻辑回归问题上的梯度下降(GD)动力学。对于可分离数据,已知 GD 在任意步长下都收敛到最小化器,但当问题不可分离时,这一性质不再成立。事实上,行为会变得更为复杂——在临界步长 (其中 为解处 Hessian 最大特征值)处,出现一系列周期分岔。使用小于临界步长可保证在解附近初始化时收敛,但这在全局范围内是否足够?在一维情况下,我们证明步长小于 即可实现全局收敛。然而,对于所有介于 与临界步长 之间的步长,都可以构造数据集使得 GD 收敛到稳定周期。 在高维情况下,甚至对小于 的步长也可能实现这一点。我们的结果表明,尽管在所有小于临界步长的条件下都保证局部收敛,但全局收敛性不一定,GD 可能根据初始化收敛到周期解。
引用
@article{arxiv.2406.05033,
title = {Gradient Descent on Logistic Regression with Non-Separable Data and Large Step Sizes},
author = {Si Yi Meng and Antonio Orvieto and Daniel Yiming Cao and Christopher De Sa},
journal= {arXiv preprint arXiv:2406.05033},
year = {2024}
}