中文

基于原始-对偶视角与改进界的无放回随机梯度下降经验风险最小化

最优化与控制 2024-02-08 v2 机器学习

摘要

随机梯度下降(SGD)或许是现代机器学习中最普遍的优化方法。与从数据集中无放回采样且(可能)每轮重洗的经验做法相反,SGD 的理论对应通常依赖于有放回采样的假设。无放回采样——无放回随机梯度下降(shuffled SGD)——的分析仅是最近才出现。对于具有 nn 个分量且在各分量函数满足 LL-光滑性假设下的凸有限和问题,在足够小——O(1nL)\mathcal{O}(\frac{1}{nL})——的步长下存在匹配的上界与下界。然而这些界显得过于悲观——事实上,所预测的性能通常并不优于全梯度下降——且与经验观测不符。在本工作中,为缩小 shuffled SGD 理论与实践间的差距,我们将关注点从一般有限和问题细化到带线性预测器的经验风险最小化。这使我们能采取原始-对偶视角,并将 shuffled SGD 解释为在对偶侧带有循环坐标更新的原始-对偶方法。利用该视角,我们证明了依赖于数据矩阵的细粒度复杂度界,其从不低于现有界所预测的结果。值得注意的是,我们的界预测到比现有分析快得多的收敛速度——在某些情况下快 n\sqrt{n} 量级。我们通过实验证明,在常见机器学习数据集上我们的界确实更紧。我们进一步将分析推广到非光滑凸问题和更一般的有限和问题,并取得类似改进。

关键词

引用

@article{arxiv.2306.12498,
  title  = {Empirical Risk Minimization with Shuffled SGD: A Primal-Dual Perspective and Improved Bounds},
  author = {Xufeng Cai and Cheuk Yin Lin and Jelena Diakonikolas},
  journal= {arXiv preprint arXiv:2306.12498},
  year   = {2024}
}