中文

AdaBatchGrad:结合自适应批量大小和自适应步长

机器学习 2024-02-09 v1 最优化与控制

摘要

本文提出了一种随机梯度下降(SGD)的新颖变体,称为AdaBatchGrad。该修改将自适应步长与可调整的批量大小无缝集成。增加批量大小和减小步长是收紧SGD收敛区域并降低其方差的众所周知的技术。R. Byrd和J. Nocedal的一系列研究引入了各种测试技术来评估小批量梯度近似的质量,并在每一步选择合适的批量大小。使用精确测试的方法被观察到在O(LR2/ε)O(LR^2/\varepsilon)次迭代内收敛。相反,不精确测试的实现有时会导致不收敛和不稳定的性能。为了应对这些挑战,AdaBatchGrad结合了自适应批量大小和步长,增强了方法的鲁棒性和稳定性。对于精确测试,我们的方法在O(LR2/ε)O(LR^2/\varepsilon)次迭代内收敛,类似于标准梯度下降。对于不精确测试,它在O(max{LR2/ε,σ2R2/ε2})O(\max\lbrace LR^2/\varepsilon, \sigma^2 R^2/\varepsilon^2 \rbrace )次迭代内实现收敛。这使得AdaBatchGrad相对于现有方法显著更加鲁棒且计算效率更高。为了证实我们方法的有效性,我们通过实验展示了自适应步长和自适应批量大小的引入如何逐步提高常规SGD的性能。结果表明,AdaBatchGrad优于其他方法,尤其是在应用于不精确测试时。

关键词

引用

@article{arxiv.2402.05264,
  title  = {AdaBatchGrad: Combining Adaptive Batch Size and Adaptive Step Size},
  author = {Petr Ostroukhov and Aigerim Zhumabayeva and Chulu Xiang and Alexander Gasnikov and Martin Takáč and Dmitry Kamzolov},
  journal= {arXiv preprint arXiv:2402.05264},
  year   = {2024}
}