基于可靠高效内存检查点的大规模容错混合并行训练
分布式、并行与集群计算
2024-08-20 v4 性能
摘要
为高效扩展大模型(LM)训练,研究者从GPU集群上的数据并行(DP)转向混合并行(HP),而此类集群频繁发生硬件与软件故障。已有工作引入内存检查点优化,将参数快照至设备内存以实现快速故障恢复。然而,这些方法在检查点与训练间引发严重资源竞争,可在DP下工作却难以在资源密集的HP下扩展。为保障混合并行训练的低检查点开销,本文提出一种近零内存保存开销的分布式内存检查点系统。它从两方面缓解内存检查点引起的宿主机资源竞争:(1)在检查点保存阶段引入分层异步快照协调。该方法采用三级设备端异步调度,增强快照与训练间的并行性,从而最小化快照开销。(2)提出混合并存检查点保护,在硬件故障时增强检查点完整性。不同于需在HP下可能阻塞训练的节点间通信方法,它以高效资源利用创建节点内冗余,以最小开销保护训练免受硬件故障。借助这些方法,本工作通过分布式内存检查点加载实现失败HP训练的快速重启,规避了NFS读取中的低效。在我们的评估中,在Frontier上使用256个MI250X设备(512 GPU)训练Llama-2-34B时,实现了零内存检查点保存开销。
引用
@article{arxiv.2310.12670,
title = {Fault-Tolerant Hybrid-Parallel Training at Scale with Reliable and Efficient In-memory Checkpointing},
author = {Yuxin Wang and Xueze Kang and Shaohuai Shi and Xin He and Zhenheng Tang and Xinglin Pan and Yang Zheng and Xiaoyu Wu and Amelie Chi Zhou and Bingsheng He and Xiaowen Chu},
journal= {arXiv preprint arXiv:2310.12670},
year = {2024}
}
备注
Fault Tolerance, Checkpoint Optimization, Large Language Model, Foundation Model, Hybrid parallelism