TRANSOM:一种高效的LLM容错训练系统
分布式、并行与集群计算
2023-10-19 v3 人工智能
摘要
以chatGPT为代表、拥有数千亿或数万亿参数的大语言模型(LLMs)已在诸多领域产生深远影响。然而,训练超大规模参数的LLM需要大型高性能GPU集群以及长达数月的训练周期。由于大规模集群中软硬件故障不可避免,维持不间断的长时间训练极具挑战性。因此,大量训练时间被用于任务检查点保存与加载、任务重新调度与重启以及任务人工异常检查,严重损害了整体训练效率。为解决这些问题,我们提出了TRANSOM,一种新颖的LLM容错训练系统。本工作中,我们设计了三个关键子系统:名为Transom Operator and Launcher(TOL)的训练流水线自动容错与恢复机制、名为Transom Eagle Eye(TEE)的训练任务多维度指标自动异常检测系统,以及名为Transom Checkpoint Engine(TCE)的训练检查点异步访问自动容错与恢复技术。其中,TOL管理训练任务的生命周期,而TEE负责任务监控与异常上报。TEE检测训练异常并上报给TOL,后者自动进入容错策略以剔除异常节点并重启训练任务。TCE提供的异步检查点保存与加载功能大幅缩短了容错开销。实验结果表明,TRANSOM显著提升了集群上大规模LLM训练的效率。具体而言,GPT3-175B的预训练时间减少了28%,而检查点保存与加载性能提升了20倍。
引用
@article{arxiv.2310.10046,
title = {TRANSOM: An Efficient Fault-Tolerant System for Training LLMs},
author = {Baodong Wu and Lei Xia and Qingping Li and Kangyu Li and Xu Chen and Yongqiang Guo and Tieyao Xiang and Yuheng Chen and Shigang Li},
journal= {arXiv preprint arXiv:2310.10046},
year = {2023}
}
备注
14 pages, 9 figures