SGD的稳定性:紧致性分析与改进界
机器学习
2021-02-11 v1 最优化与控制
机器学习
摘要
基于随机梯度下降(SGD)的方法已被广泛用于训练大规模机器学习模型,且这些模型在实践中也具有良好泛化性。已有多种解释用于说明此泛化性能,其中著名的一种是算法稳定性[18]。然而,尚无已知的光滑损失函数示例可证明其分析是紧的。此外,除损失函数的性质外,数据分布也被证明是泛化性能的重要因素。这引出一个问题:[18]的稳定性分析对光滑函数是否紧致?若不紧致,对于何种损失函数和数据分布可改进稳定性分析?本文中,我们首先解决了数据无关设定下界的紧致性相关的开放问题:我们表明对于一般数据集,现有的凸和强凸损失函数分析是紧的,但对非凸损失函数可改进。接下来,我们给出新颖且改进的数据相关界:我们展示了对于一大类具有可忽略正则化参数的凸正则化损失函数的稳定性上界,并改进了非凸设定下现有的数据相关界。我们希望我们的结果能引发进一步努力,以更好理解非凸损失函数下的数据相关设定,从而增进对深度网络泛化能力的理解。
引用
@article{arxiv.2102.05274,
title = {Stability of SGD: Tightness Analysis and Improved Bounds},
author = {Yikai Zhang and Wenjia Zhang and Sammy Bald and Vamsi Pingali and Chao Chen and Mayank Goswami},
journal= {arXiv preprint arXiv:2102.05274},
year = {2021}
}