DoG 是 SGD 的最佳伙伴:一种无参数的动态步长调度
机器学习
2023-07-18 v3 最优化与控制
摘要
我们提出一种无需调参的动态 SGD 步长公式,称之为距离除以梯度(Distance over Gradients, DoG)。DoG 步长依赖于简单的经验量(距初始点的距离与梯度范数)且不具有“学习率”参数。理论上,我们表明 DoG 公式的一个轻微变体在仅假设\emph{局部有界}随机梯度的随机凸优化下享有强无参数收敛保证。在经验上,我们考虑广泛的视觉与语言迁移学习任务,并表明 DoG 的性能接近带调优学习率的 SGD。我们还提出 DoG 的逐层变体,其通常优于调优的 SGD,接近调优 Adam 的性能。PyTorch 实现可在 https://github.com/formll/dog 获取。
引用
@article{arxiv.2302.12022,
title = {DoG is SGD's Best Friend: A Parameter-Free Dynamic Step Size Schedule},
author = {Maor Ivgi and Oliver Hinder and Yair Carmon},
journal= {arXiv preprint arXiv:2302.12022},
year = {2023}
}
备注
To appear at ICML 2023