中文

Adafactor:具有亚线性内存开销的自适应学习率

机器学习 2018-04-13 v1 人工智能 机器学习

摘要

在若干近期提出的随机优化方法(如RMSProp、Adam、Adadelta)中,参数更新由过去平方梯度的指数移动平均的逆平方根缩放。维护这些逐参数二阶矩估计器所需内存等于参数数量。对于神经网络权重矩阵的情形,我们提议仅维护这些移动平均的逐行与逐列和,并基于这些和估计逐参数二阶矩。我们通过实验证明该方法产生与基线相似的结果。其次,我们表明当二阶矩累加器的衰减率过慢时,自适应方法会产生大于期望的更新。我们提出更新截断与逐渐增加的衰减率方案作为补救。结合这些方法并舍弃动量,我们在WMT 2014英德机器翻译任务上训练Transformer模型时取得了与已发表Adam机制相当的结果,同时在优化器中使用了极少的辅助存储。最后,我们提议基于参数自身的尺度来缩放参数更新。

关键词

引用

@article{arxiv.1804.04235,
  title  = {Adafactor: Adaptive Learning Rates with Sublinear Memory Cost},
  author = {Noam Shazeer and Mitchell Stern},
  journal= {arXiv preprint arXiv:1804.04235},
  year   = {2018}
}