中文

关于自适应优化中未调参预热充分性的探讨

机器学习 2021-03-23 v3 神经与进化计算 机器学习

摘要

Adam 等自适应优化算法在深度学习中被广泛使用。此类算法的稳定性常通过学习率预热调度得以改善。受选择和调参预热调度困难的驱动,近期工作提出了对 Adam 自适应学习率的自动方差修正,声称该修正方法(“RAdam”)超越了原始 Adam 算法,并减少了对 Adam 配合预热进行昂贵调参的需求。在本工作中,我们反驳了这一分析,并基于更新项的大小给出了预热必要性的另一种解释,该因素与训练稳定性更相关。随后我们提供了一些“经验法则”式的预热调度,并证明在典型实际设置中,Adam 的简单未调参预热与 RAdam 表现大体相同。最后我们建议从业者坚持使用 Adam 的线性预热,一个合理的默认设置是在 2/(1β2)2 / (1 - \beta_2) 次训练迭代上进行线性预热。

关键词

引用

@article{arxiv.1910.04209,
  title  = {On the adequacy of untuned warmup for adaptive optimization},
  author = {Jerry Ma and Denis Yarats},
  journal= {arXiv preprint arXiv:1910.04209},
  year   = {2021}
}

备注

AAAI 2021