中文

带偏自适应随机逼近的非渐近分析

机器学习 2025-03-17 v2 机器学习

摘要

采用自适应步长的随机梯度下降 (SGD) 被广泛用于训练深度神经网络和生成模型。大多数理论结果假设可以获得无偏梯度估计量,但这在使用蒙特卡洛方法的若干近期深度学习和强化学习应用中并不成立。本文针对非凸光滑函数,对具有偏置梯度和自适应步长的 SGD 提供了全面的非渐近分析。我们的研究纳入了随时间变化的偏置,并强调了控制梯度估计量偏置的重要性。特别是,我们证明了 Adagrad、RMSProp 和 AMSGRAD(Adam 的指数移动平均变体)在带有偏置梯度的情况下,对于光滑非凸函数能收敛到临界点,其收敛速率与文献中无偏情况下的现有结果相似。最后,我们利用变分自编码器 (VAE) 提供了实验结果,并展示了在多个学习框架中的应用,这些结果阐明了我们的收敛性结论,并说明了如何通过适当的超参数调整来减小偏置的影响。

关键词

引用

@article{arxiv.2402.02857,
  title  = {Non-asymptotic Analysis of Biased Adaptive Stochastic Approximation},
  author = {Sobihan Surendran and Antoine Godichon-Baggioni and Adeline Fermanian and Sylvain Le Corff},
  journal= {arXiv preprint arXiv:2402.02857},
  year   = {2025}
}