中文

深度学习中的强扩展性案例:利用混合并行训练大型三维CNN

分布式、并行与集群计算 2020-07-28 v1 机器学习

摘要

我们提出了用于训练大规模三维卷积神经网络的可扩展混合并行算法。基于深度学习的新兴科学工作流通常需要使用大型高维样本进行模型训练,这可能导致训练成本大幅增加,甚至因内存过度消耗而不可行。我们通过在端到端训练流程(包括计算和I/O)中广泛应用混合并行来解决这些挑战。我们的混合并行算法通过空间并行扩展了标准的数据并行,即在空间域上划分单个样本,从而以更大的聚合内存容量实现了超越小批量维度的强扩展。我们使用两个具有挑战性的三维CNN——CosmoFlow和三维U-Net——来评估所提出的训练算法。我们全面的性能研究表明,使用多达2000个GPU,两个网络都能实现良好的弱扩展和强扩展。更重要的是,我们使得CosmoFlow能够使用比以往大得多的样本进行训练,从而在预测精度上实现了数量级的提升。

关键词

引用

@article{arxiv.2007.12856,
  title  = {The Case for Strong Scaling in Deep Learning: Training Large 3D CNNs with Hybrid Parallelism},
  author = {Yosuke Oyama and Naoya Maruyama and Nikoli Dryden and Erin McCarthy and Peter Harrington and Jan Balewski and Satoshi Matsuoka and Peter Nugent and Brian Van Essen},
  journal= {arXiv preprint arXiv:2007.12856},
  year   = {2020}
}

备注

12 pages, 10 figures