中文

可分离数据上梯度下降的紧风险界

机器学习 2023-03-03 v1

摘要

我们研究应用于可分离线性分类的非正则化梯度方法的泛化性质——自 Soudry 等人(2018)的开创性工作以来,该设定已受到相当关注。在此设定下,我们对任意光滑损失函数建立了梯度下降的紧上界和下界(总体)风险界,以该函数的尾部衰减率表示。我们的界形如 Θ(r,T2/γ2T+r,T2/γ2n)\Theta(r_{\ell,T}^2 / \gamma^2 T + r_{\ell,T}^2 / \gamma^2 n),其中 TT 为梯度步数,nn 为训练集大小,γ\gamma 为数据间隔,r,Tr_{\ell,T} 为依赖于损失函数(及 TT 的)尾部衰减率的复杂度项。我们的上界与 Shamir(2021)、Schliserman 和 Koren(2022)已知的最佳上界一致,同时将适用范围扩展到几乎任意光滑损失函数并放宽了它们所施加的技术假设。我们的风险下界是此背景下首个下界,并确立了对于任意给定尾部衰减率和所有参数区间上界的紧性。用于证明这些结果的技术相较先前工作也明显更简单,且可直接扩展到其他梯度方法;我们通过给出随机梯度下降的类似结果来说明这一点。

关键词

引用

@article{arxiv.2303.01135,
  title  = {Tight Risk Bounds for Gradient Descent on Separable Data},
  author = {Matan Schliserman and Tomer Koren},
  journal= {arXiv preprint arXiv:2303.01135},
  year   = {2023}
}