中文

非凸学习中SGLD的泛化界:两种理论视角

机器学习 2017-07-20 v1 最优化与控制 机器学习

摘要

依赖于算法的泛化误差界是统计学习理论的核心。学习算法可能使用很大的假设空间,但有限的迭代次数控制其模型容量和泛化误差。随机梯度方法对非凸学习问题泛化误差的影响不仅具有重要的理论后果,而且对深度学习的泛化误差至关重要。在本文中,我们研究具有非凸目标的随机梯度朗之万动力学(SGLD)的泛化误差。利用稳定性和 PAC-Bayesian 结果分别提出了两种基于非渐近离散时间分析的理论。基于稳定性的理论得到了 O(1nLβTk)O\left(\frac{1}{n}L\sqrt{\beta T_k}\right) 的界,其中 LL 是一致 Lipschitz 参数,β\beta 是逆温度,TkT_k 是累积步长。对于 PAC-Bayesian 理论,尽管该界具有较慢的 O(1/n)O(1/\sqrt{n}) 速率,但通过施加 2\ell^2 正则化,每一步的贡献以指数衰减因子显示,且一致 Lipschitz 常数也被沿轨迹梯度的实际范数所替代。我们的界没有对参数维度、范数或其他容量度量的隐式依赖,这优雅地刻画了非凸设置中“快速训练保证泛化”的现象。这是首个对非凸学习累积步长具有合理依赖的算法相关结果,并且对深度学习等复杂模型中随机梯度方法的统计学习方面具有重要意义。

关键词

引用

@article{arxiv.1707.05947,
  title  = {Generalization Bounds of SGLD for Non-convex Learning: Two Theoretical Viewpoints},
  author = {Wenlong Mou and Liwei Wang and Xiyu Zhai and Kai Zheng},
  journal= {arXiv preprint arXiv:1707.05947},
  year   = {2017}
}