中文

AdaScale SGD:一种用户友好的分布式训练算法

机器学习 2020-07-13 v1 机器学习

摘要

在使用大批量训练加速随机梯度下降时,学习率必须适应新的批量大小,以最大化加速并保持模型质量。重新调整学习率消耗大量资源,而固定的缩放规则常使模型质量下降。我们提出 AdaScale SGD,一种可靠地将学习率适应于大批量训练的算法。通过持续适应梯度的方差,AdaScale 自动实现对广泛批量大小的加速。我们用 AdaScale 的收敛界形式化描述了这一性质,其保持最终目标值,即使批量大小增大且迭代次数减少。在实证比较中,AdaScale 的训练远超流行的“线性学习率缩放”规则的批量大小限制。这包括在机器翻译、图像分类、目标检测和语音识别任务中无模型退化的超大批量训练。AdaScale 的定性行为类似于“warm-up”启发式方法,但不同于 warm-up,该行为由一种有原则的机制自然涌现。该算法引入可忽略的计算开销且无新超参数,使 AdaScale 成为实际大规模训练的理想选择。

关键词

引用

@article{arxiv.2007.05105,
  title  = {AdaScale SGD: A User-Friendly Algorithm for Distributed Training},
  author = {Tyler B. Johnson and Pulkit Agrawal and Haijie Gu and Carlos Guestrin},
  journal= {arXiv preprint arXiv:2007.05105},
  year   = {2020}
}

备注

ICML 2020