中文

一种用于指导卷积神经网络大规模模型/混合并行训练的预言机

分布式、并行与集群计算 2021-04-20 v1 机器学习

摘要

深度神经网络(DNN)框架采用分布式训练,以加快收敛时间并在训练大型模型和/或使用高维输入时缓解内存容量限制。随着数据集和模型规模的稳步增长,模型/混合并行被认为将在DNN分布式训练的未来中发挥重要作用。我们分析了卷积神经网络(CNN)的计算、通信和内存需求,以理解不同并行方法在性能和可扩展性之间的权衡。我们利用模型驱动的分析作为预言机工具的基础,该工具可帮助检测大规模下不同并行方法的局限性和瓶颈。我们在多达1024个GPU上,使用四种CNN模型和多个数据集(2D和3D),对六种并行化策略评估了该预言机。结果表明,与经验结果相比,该预言机的平均准确率约为86.74%,对于数据并行则高达97.57%。

关键词

引用

@article{arxiv.2104.09075,
  title  = {An Oracle for Guiding Large-Scale Model/Hybrid Parallel Training of Convolutional Neural Networks},
  author = {Albert Njoroge Kahira and Truong Thao Nguyen and Leonardo Bautista Gomez and Ryousei Takano and Rosa M Badia and Mohamed Wahib},
  journal= {arXiv preprint arXiv:2104.09075},
  year   = {2021}
}

备注

The International ACM Symposium on High-Performance Parallel and Distributed Computing 2021 (HPDC'21)