中文

Amos:一种具有面向模型尺度自适应权重衰减的 Adam 风格优化器

机器学习 2022-11-22 v2

摘要

我们提出 Amos,一种基于随机梯度的优化器,专为训练深度神经网络而设计。它可视为带有理论支撑的自适应学习率衰减与权重衰减的 Adam 优化器。Amos 背后的关键洞见在于利用模型特定信息来确定初始学习率与衰减调度。当用于预训练 BERT 变体与 T5 时,Amos 始终比 AdamW 的当前最优设置收敛更快,在不超过 70% 的训练步数与时间内取得更优验证损失,同时槽变量所需内存不超过 51%。我们的代码已开源:https://github.com/google-research/jestimator

关键词

引用

@article{arxiv.2210.11693,
  title  = {Amos: An Adam-style Optimizer with Adaptive Weight Decay towards Model-Oriented Scale},
  author = {Ran Tian and Ankur P. Parikh},
  journal= {arXiv preprint arXiv:2210.11693},
  year   = {2022}
}