中文

关于自适应梯度算法的随机微分方程与缩放规则

机器学习 2024-11-04 v3

摘要

将随机梯度下降(SGD)近似为随机微分方程(SDE)使研究者得以在仔细保持 SGD 随机性的同时享受研究连续优化轨迹的益处。对 RMSprop 与 Adam 等自适应梯度方法的类似研究一直具有挑战性,因为此前没有对这些方法严格证明的 SDE 近似。本文推导了 RMSprop 与 Adam 的 SDE 近似,给出其正确性的理论保证,并以在常见大规模视觉与语言设定中的实验验证其适用性。一个关键的实用结果是推导了在改变批量大小时调整 RMSprop 与 Adam 优化超参数的 平方根缩放规则\textit{平方根缩放规则},及其在深度学习设定中的经验验证。

关键词

引用

@article{arxiv.2205.10287,
  title  = {On the SDEs and Scaling Rules for Adaptive Gradient Algorithms},
  author = {Sadhika Malladi and Kaifeng Lyu and Abhishek Panigrahi and Sanjeev Arora},
  journal= {arXiv preprint arXiv:2205.10287},
  year   = {2024}
}

备注

revised for correcting errors in some figures