一种用于深度学习训练的千万亿次级异构集群协同设计新方法
计算机视觉与模式识别
2018-05-22 v3
摘要
大规模深度卷积神经网络(CNNs)对计算能力的需求日益增长。对于研究人员而言,拥有一个强大的计算平台以推动深度学习(DL)发展至关重要。另一方面,作为常用加速器,新一代商用GPU卡越来越昂贵。因此,设计一个提供强大计算能力且价格可承受的分布式异构系统,并开发能高效利用其计算能力的适配软件十分重要。本文提出一种协同设计的分布式系统,包括一个称为“Manoa”的千万亿次级GPU集群。基于Manoa的特性和拓扑结构,我们首先提出并实现了一个称为“MiMatrix”的作业服务器框架。MiMatrix的中心节点被称为作业服务器,承担所有控制、调度和监控以及I/O任务,且在每次迭代中不进行AllReduce处理的权重数据传输。因此,MiMatrix从根本上解决了广泛用于分布式DL任务的参数服务器框架中中心节点的带宽瓶颈问题。同时,我们还提出了一种新的AllReduce算法,即GPUDirect RDMA感知的AllReduce(GDRAA),其中计算和握手消息复杂度均为O(1),且每次迭代的同步次数为两次,这是理论最小值。得益于专用的协同设计分布式系统,MiMatrix高效地利用了Manoa的计算能力和带宽。我们在Imagenet-1K数据集上对Manoa的Resnet50和Resenet101进行了基准测试。部分结果展示了最先进的(state-of-the-art)性能。
引用
@article{arxiv.1802.02326,
title = {A Novel Co-design Peta-scale Heterogeneous Cluster for Deep Learning Training},
author = {Xin Chen and Hua Zhou and Yuxiang Gao and Yu Zhu},
journal= {arXiv preprint arXiv:1802.02326},
year = {2018}
}
备注
23 pages, 4 figures, 1 table