关于自适应梯度算法的随机微分方程与缩放规则
机器学习
2024-11-04 v3
摘要
将随机梯度下降(SGD)近似为随机微分方程(SDE)使研究者得以在仔细保持 SGD 随机性的同时享受研究连续优化轨迹的益处。对 RMSprop 与 Adam 等自适应梯度方法的类似研究一直具有挑战性,因为此前没有对这些方法严格证明的 SDE 近似。本文推导了 RMSprop 与 Adam 的 SDE 近似,给出其正确性的理论保证,并以在常见大规模视觉与语言设定中的实验验证其适用性。一个关键的实用结果是推导了在改变批量大小时调整 RMSprop 与 Adam 优化超参数的 ,及其在深度学习设定中的经验验证。
引用
@article{arxiv.2205.10287,
title = {On the SDEs and Scaling Rules for Adaptive Gradient Algorithms},
author = {Sadhika Malladi and Kaifeng Lyu and Abhishek Panigrahi and Sanjeev Arora},
journal= {arXiv preprint arXiv:2205.10287},
year = {2024}
}
备注
revised for correcting errors in some figures