无参数裁剪梯度下降与 Polyak 步长
机器学习
2024-11-01 v2 最优化与控制
摘要
梯度下降及其变体是训练机器学习模型事实上的标准算法。由于梯度下降对其超参数敏感,需要谨慎调整超参数。然而,网格搜索方法耗时尤其当存在多个超参数时。因此,近期研究分析了无参数方法,这些方法在运行中动态调整超参数。然而,现有工作仅限于步长的无参数方法,其他超参数的无参数方法尚未被探讨。例如,虽然梯度裁剪阈值是防止梯度爆炸的关键超参数,除步长外,现有研究尚未针对裁剪梯度下降提出无参数方法。因此,本文研究了裁剪梯度下降的无参数方法。具体而言,我们提出不完全 Polyak 步长法,该方法无需超参数调优即可收敛至最优解,且其收敛率在 -光滑且 -光滑假设下,与使用经调优超参数的裁剪梯度下降一样,与 无关。我们通过合成函数数值验证了收敛结果,并在 LSTM、Nano-GPT 和 T5 上展示了所提方法的有效性。
引用
@article{arxiv.2405.15010,
title = {Parameter-free Clipped Gradient Descent Meets Polyak},
author = {Yuki Takezawa and Han Bao and Ryoma Sato and Kenta Niwa and Makoto Yamada},
journal= {arXiv preprint arXiv:2405.15010},
year = {2024}
}
备注
NeurIPS 2024