中文

重访梯度裁剪:随机偏差与紧致收敛保证

机器学习 2023-11-10 v2 分布式、并行与集群计算 最优化与控制 机器学习

摘要

梯度裁剪是对标准(随机)梯度下降的一种流行修改,在每次迭代时将梯度范数限制在某个值 c>0c >0。它被广泛用于例如稳定深度学习模型的训练(Goodfellow et al., 2016),或用于实施差分隐私(Abadi et al., 2016)。尽管裁剪机制简单且流行,其收敛保证常需要特定的 cc 值和强噪声假设。在本文中,我们给出收敛保证,显示了对任意裁剪阈值 cc 的精确依赖,并表明我们的保证在确定性梯度和随机梯度下都是紧致的。特别地,我们表明(i)对于确定性梯度下降,裁剪阈值仅影响收敛的高阶项,(ii)在随机设定下,即使在任意小步长下,在标准噪声假设下也无法保证收敛到真正的最优解。我们给出了运行裁剪 SGD 时梯度范数收敛的匹配上界和下界,并用实验说明了这些结果。

关键词

引用

@article{arxiv.2305.01588,
  title  = {Revisiting Gradient Clipping: Stochastic bias and tight convergence guarantees},
  author = {Anastasia Koloskova and Hadrien Hendrikx and Sebastian U. Stich},
  journal= {arXiv preprint arXiv:2305.01588},
  year   = {2023}
}