中文

在 GPU 集群上以混合精度训练分布式深度循环神经网络

机器学习 2019-12-03 v1

摘要

在本文中,我们评估了使用半精度浮点数训练深度循环神经网络。我们通过集成 TensorFlow 和 CUDA-aware MPI 实现了一种分布式、数据并行、同步的训练算法,以在多个 GPU 节点上执行并利用高速互连。我们引入了一种学习率调度策略,可在多达 O(100)O(100) 个工作节点下促进神经网络收敛。在 NVIDIA Pascal P100 GPU 集群上进行的强缩放测试显示,单精度和混合精度训练模式均呈线性运行时间和对数通信时间缩放。性能在取自 Joint European Torus (JET) 托卡马克的科学数据集上进行了评估,该数据集包含导致称为等离子体破裂的有害事件的多模态时间序列感官测量数据,以及基准 Large Movie Review Dataset~\cite{imdb}。半精度显著减少了内存和网络带宽,使得能够训练具有超过 7000 万可训练参数的最先进模型,同时达到与单精度相当的测试集性能。

关键词

引用

@article{arxiv.1912.00286,
  title  = {Training Distributed Deep Recurrent Neural Networks with Mixed Precision on GPU Clusters},
  author = {Alexey Svyatkovskiy and Julian Kates-Harbeck and William Tang},
  journal= {arXiv preprint arXiv:1912.00286},
  year   = {2019}
}