中文

对偶平均在深度学习优化中出奇有效

机器学习 2020-10-21 v1 最优化与控制 机器学习

摘要

一阶随机优化方法目前是训练深度神经网络最广泛使用的一类方法。然而,优化器的选择已成为一种可能显著影响性能的临时规则。例如,带动量的 SGD(SGD+M)通常用于计算机视觉(CV),而 Adam 用于训练自然语言处理(NLP)的 Transformer 模型。使用错误的方法会导致显著的性能下降。受对偶平均算法启发,我们提出现代化对偶平均(MDA),一种在 CV 上能与 SGD+M 表现相当、在 NLP 上能与 Adam 表现相当的优化器。我们的方法非自适应,且比 Adam 简单得多。我们表明,与原始 SGD+M 相比,MDA 引入了衰减的非中心化 L2L_2 正则化,并假设这或许解释了它为何在 SGD+M 失效的 NLP 问题上有效。

关键词

引用

@article{arxiv.2010.10502,
  title  = {Dual Averaging is Surprisingly Effective for Deep Learning Optimization},
  author = {Samy Jelassi and Aaron Defazio},
  journal= {arXiv preprint arXiv:2010.10502},
  year   = {2020}
}