中文

通过利用二阶矩与幅值扩展 AdamW

机器学习 2021-12-14 v1 人工智能 最优化与控制

摘要

近期工作 [4] 分析了 Adam 在二次可微函数最优解邻域内的局部收敛性,发现学习率必须足够小以确保最优解的局部稳定性。上述收敛结果对 AdamW 同样成立。本工作中,我们从两个方面扩展 AdamW 以放宽其对小学习率以实现局部稳定性的要求,提出一种称为 Aida 的新自适应优化方法。首先,我们考虑追踪梯度幅值的 p 次幂的二阶矩 r_t。当 p=2 时,r_t 退化为 AdamW 的 v_t。设 {m_t} 为 AdamW 的一阶矩。已知更新方向 m_{t+1}/(v_{t+1}+epsilon)^0.5(或 AdamW(或 Adam)的 m_{t+1}/(v_{t+1}^0.5+epsilon))可分解为符号向量 sign(m_{t+1}) 逐元素乘以幅值向量 |m_{t+1}|/(v_{t+1}+epsilon)^0.5(或 |m_{t+1}|/(v_{t+1}^0.5+epsilon))。Aida 被设计为以 |m_{t+1}|^q/(r_{t+1}+epsilon)^(q/p)(或 |m_{t+1}|^q/((r_{t+1})^(q/p)+epsilon))的形式计算幅值的 q 次幂,当 (p,q)=(2,1) 时退化为 AdamW 的形式。设原点 0 为二次可微函数的局部最优解。理论上发现,当 Aida 中 q>1 且 p>1 时,仅当权重衰减非零时原点 0 才是局部稳定的。实验针对十个玩具优化问题以及训练 Transformer 和 Swin-Transformer 完成两个深度学习(DL)任务展开。实证研究表明,在许多场景(包括两个 DL 任务)中,特定 (p,q) 不等于 (2,1) 的 Aida 优于 AdamW 的 (p,q)=(2,1) 设置。

关键词

引用

@article{arxiv.2112.06125,
  title  = {Extending AdamW by Leveraging Its Second Moment and Magnitude},
  author = {Guoqiang Zhang and Niwa Kenta and W. Bastiaan Kleijn},
  journal= {arXiv preprint arXiv:2112.06125},
  year   = {2021}
}

备注

9 pages