深度神经网络分布式训练入门指南
机器学习
2018-10-30 v1 人工智能
分布式、并行与集群计算
机器学习
摘要
深度学习已在人工智能领域带来巨大进步。然而一个 caveat 是训练这些深度学习模型需要大量计算资源。在单机现代 GPU 上训练 ImageNet 这类基准数据集可能耗时长达一周,而观察到将训练分布到多台机器上可大幅缩短该时间。近期工作通过使用 2048 块 GPU 的集群将 ImageNet 训练时间缩短至低至 4 分钟。本文调研了用于分布式训练的各种算法与技术,并给出了现代分布式训练框架的当前 SOTA。更具体地,我们探讨了分布式随机梯度下降(Stochastic Gradient Descent)的同步与异步变体、各种 All Reduce 梯度聚合策略,以及用于在集群上获得更高吞吐量和更低延迟的最佳实践,如混合精度训练、大批量训练与梯度压缩。
引用
@article{arxiv.1810.11787,
title = {A Hitchhiker's Guide On Distributed Training of Deep Neural Networks},
author = {Karanbir Chahal and Manraj Singh Grover and Kuntal Dey},
journal= {arXiv preprint arXiv:1810.11787},
year = {2018}
}
备注
14 pages