在海量科学数据集上并行训练深度生成模型
分布式、并行与集群计算
2019-10-08 v1 机器学习
高能物理 - 实验
计算物理
摘要
在大型科学数据上训练深度神经网络是一项具有挑战性的任务,需要巨大的计算能力,尤其是在不存在预训练模型来初始化该过程时。我们提出一种新颖的竞赛方法,用于训练基于 LBANN 构建的传统网络以及生成对抗网络(GAN),LBANN 是一个为 HPC 系统优化的可扩展深度学习框架。LBANN 结合了多级并行并利用了部分全球最大的超级计算机。我们通过基于来自高能密度物理的多变量数据创建一个复杂的预测模型来展示我们的框架,该数据包含数亿张图像和数亿个标量值,这些数据源自数千万次惯性约束聚变模拟。我们的方法结合了 HPC 工作流,并通过优化的数据摄取和新的竞赛式训练算法扩展 LBANN,以利用 CORAL 级超级计算机生成可扩展的神经网络架构。实验结果表明,64 个训练器(1024 个 GPU)相较单个训练器(16 个 GPU)基线实现了 70.2 的加速比,以及有效的 109% 并行效率。
引用
@article{arxiv.1910.02270,
title = {Parallelizing Training of Deep Generative Models on Massive Scientific Datasets},
author = {Sam Ade Jacobs and Brian Van Essen and David Hysom and Jae-Seung Yeom and Tim Moon and Rushil Anirudh and Jayaraman J. Thiagaranjan and Shusen Liu and Peer-Timo Bremer and Jim Gaffney and Tom Benson and Peter Robinson and Luc Peterson and Brian Spears},
journal= {arXiv preprint arXiv:1910.02270},
year = {2019}
}