循环与随机步长比固定步长使 SGD 产生更重尾
机器学习
2023-08-30 v2 机器学习
最优化与控制
摘要
循环步长与随机步长在深度学习实践中被广泛使用,且常能优于 SGD 中固定步长等标准步长选择。尽管取得了经验上的成功,目前关于它们何时以及为何能在理论上改善泛化性能所知甚少。我们考虑一类通用的马尔可夫步长用于学习,其将独立同分布随机步长、循环步长以及固定步长作为特例包含在内;受文献表明 SGD 迭代中尾部的重度(由所谓“尾指数”度量)与泛化相关这一发现的启发,我们研究尾指数并给出若干理论结果,揭示尾指数如何随步长调度而变化。我们的结果从尾部行为角度带来了对循环与随机步长相对于固定步长优势的新理解。我们在线性回归实验上阐释理论,并通过深度学习实验表明马尔可夫步长甚至可达到更重的尾部,并可作为循环与独立同分布随机步长规则的可行替代。
引用
@article{arxiv.2302.05516,
title = {Cyclic and Randomized Stepsizes Invoke Heavier Tails in SGD than Constant Stepsize},
author = {Mert Gürbüzbalaban and Yuanhan Hu and Umut Şimşekli and Lingjiong Zhu},
journal= {arXiv preprint arXiv:2302.05516},
year = {2023}
}
备注
To Appear