用于缓解梯度延迟的自适应制动
机器学习
2020-07-13 v2 分布式、并行与集群计算
最优化与控制
机器学习
摘要
神经网络训练通常通过使用多个同步工作节点并行计算梯度更新来加速。异步方法消除了同步开销并提高了硬件利用率,但代价是引入了梯度延迟,这会阻碍优化并可能导致最终模型性能下降。我们引入了自适应制动(Adaptive Braking,AB),这是一种对基于动量的优化器的修改,旨在减轻梯度延迟的影响。AB 根据梯度与速度的对齐程度动态缩放梯度。这可以抑制沿损失曲面高曲率方向的振荡,从而稳定并加速异步训练。我们展示了在带动量的 SGD 之上应用 AB,能够在延迟 32 个更新步长的情况下训练 ResNet 于 CIFAR-10 和 ImageNet-1k 数据集,且最终测试准确率下降极小。
引用
@article{arxiv.2007.01397,
title = {Adaptive Braking for Mitigating Gradient Delay},
author = {Abhinav Venigalla and Atli Kosson and Vitaliy Chiley and Urs Köster},
journal= {arXiv preprint arXiv:2007.01397},
year = {2020}
}
备注
In Beyond First Order Methods in ML Systems workshop at the 37th International Conference on Machine Learning, 2020