中文

基于离散与连续先验的梯度方法泛化界

机器学习 2022-10-12 v4

摘要

近年来,在学习理论中证明依赖于算法的梯度型优化方法泛化误差界引起了广泛关注。然而,大多数现有的基于轨迹的分析要么需要对学习率施加限制性假设(例如快速递减的学习率),要么需要连续注入噪声(如朗之万动力学中的高斯噪声)。在本文中,我们向 PAC-Bayesian 框架引入一种新的离散数据依赖先验,并为 Floored GD(即具有精度水平 εt\varepsilon_t 的梯度下降版本)证明了阶数为 O(1nt=1T(γt/εt)2gt2)O(\frac{1}{n}\cdot \sum_{t=1}^T(\gamma_t/\varepsilon_t)^2\left\|{\mathbf{g}_t}\right\|^2) 的高概率泛化界,其中 nn 为训练样本数,γt\gamma_t 为第 tt 步的学习率,gt\mathbf{g}_t 大致为使用全部样本计算的梯度与仅使用先验样本计算的梯度之差。gt\left\|{\mathbf{g}_t}\right\| 有上界且通常远小于梯度范数 f(Wt)\left\|{\nabla f(W_t)}\right\|。我们注意到,我们的界在非凸和非光滑情形下均成立。此外,我们的理论结果给出了数值上良好的测试误差上界(例如在 MNIST 上为 0.0370.037)。利用类似技术,我们也能获得某些 SGD 变体的新泛化界。进一步,我们研究了梯度朗之万动力学(GLD)的泛化界。使用相同框架并精心构造连续先验,我们给出了 GLD 的阶数为 O(1n+L2n2t=1T(γt/σt)2)O(\frac{1}{n} + \frac{L^2}{n^2}\sum_{t=1}^T(\gamma_t/\sigma_t)^2) 的新高概率泛化界。新的 1/n21/n^2 速率源于训练样本梯度与先验梯度之差的集中性。

关键词

引用

@article{arxiv.2205.13799,
  title  = {Generalization Bounds for Gradient Methods via Discrete and Continuous Prior},
  author = {Xuanyuan Luo and Luo Bei and Jian Li},
  journal= {arXiv preprint arXiv:2205.13799},
  year   = {2022}
}

备注

Published in NeurIPS 2022