中文

迈向对延迟随机梯度下降泛化性的理解

机器学习 2025-05-27 v4

摘要

以异步方式执行的随机梯度下降(SGD)在训练大规模机器学习模型中起着关键作用。然而,作为评估机器学习算法重要指标的异步延迟SGD的泛化性能却鲜有探究。现有泛化误差界相当悲观,无法揭示异步延迟与泛化之间的关联。本文研究带异步延迟τ\tau的SGD的更紧泛化误差界。利用生成函数分析工具,我们首先建立延迟梯度算法的平均稳定性。基于此算法稳定性,我们对二次凸与强凸问题分别给出O~(Tτnτ)\tilde{\mathcal{O}}(\frac{T-\tau}{n\tau})O~(1n)\tilde{\mathcal{O}}(\frac{1}{n})的泛化误差上界,其中TT为迭代次数,nn为训练数据量。我们的理论结果表明,异步延迟降低了延迟SGD算法的泛化误差。类似分析可推广至随机延迟设定,实验结果验证了我们的理论发现。

关键词

引用

@article{arxiv.2308.09430,
  title  = {Towards Understanding the Generalizability of Delayed Stochastic Gradient Descent},
  author = {Xiaoge Deng and Li Shen and Shengwei Li and Tao Sun and Dongsheng Li and Dacheng Tao},
  journal= {arXiv preprint arXiv:2308.09430},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025