大规模深度神经网络训练中的检查点技术研究
分布式、并行与集群计算
2021-03-30 v2
摘要
深度学习(DL)应用正日益部署于HPC系统上,以利用这些系统的大规模并行性与计算能力进行DL模型训练。尽管DL框架在促进分布式训练方面已投入大量努力,容错却被很大程度上忽视。在本工作中,我们评估了检查点-重启这一HPC负载中常见的容错技术。我们使用HPC中常见的三种最先进DL框架(Chainer、PyTorch和TensorFlow)进行实验。我们评估了检查点的计算成本、文件格式与文件大小、规模的影响以及确定性检查点。我们的评估显示了检查点机制的一些关键差异,并暴露了现有检查点实现中的若干瓶颈。我们提供了可帮助用户在高性能计算中选择容错框架的讨论要点。我们也提供了框架开发者可用于促进HPC中DL负载更好检查点的启示要点。
引用
@article{arxiv.2012.00825,
title = {A Study of Checkpointing in Large Scale Training of Deep Neural Networks},
author = {Elvis Rojas and Albert Njoroge Kahira and Esteban Meneses and Leonardo Bautista Gomez and Rosa M Badia},
journal= {arXiv preprint arXiv:2012.00825},
year = {2021}
}