FlashRecovery:用于大规模 LLM 训练的快速低成本故障恢复系统
分布式、并行与集群计算
2025-09-04 v1 人工智能
摘要
大型语言模型 (LLM) 由于其先进的能力而在各个领域产生了深远影响。然而, 在规模 unprecedented 的训练中需要大量 AI 加速器集群和复杂的并行策略, 这在维持长期训练期间系统可靠性方面提出了重大挑战。主要关切是因不可避免的硬件和软件故障导致的训练时间大幅损失。为此, 我们提出了 FlashRecovery, 一个快速低成本的故障恢复系统, 由三个核心模块组成: (1) 主动实时故障检测。该模块持续监控训练状态, 在数秒内实现对硬件和软件故障的即时识别,确保快速 incident response; (2) 与规模无关的任务重启。通过为正常节点和故障节点采用不同恢复策略, 并结合优化的通信组重构协议, 我们的方法确保恢复时间几乎不受集群规模影响; (3) 步骤内无需检查点恢复。我们新颖的恢复机制实现单步骤恢复, 完全消除对传统检查点方法及其相关开销的依赖。总体而言, 这些创新使 FlashRecovery 能够实现最佳的恢复时间目标 (RTO) 和恢复点目标 (RPO), 大幅提高了长期 LLM 训练的可靠性和效率。实验结果表明, FlashRecovery 系统可在 4800 台设备的训练集群上实现 150 秒内的训练恢复。我们还验证了不同规模训练任务的故障恢复所需时间几乎保持一致。
引用
@article{arxiv.2509.03047,
title = {FlashRecovery: Fast and Low-Cost Recovery from Failures for Large-Scale Training of LLMs},
author = {Haijun Zhang and Jinxiang Wang and Zhenhua Yu and Yanyong Zhang and Xuejie Ji and Kaining Mao and Jun Zhang and Yaqing Zhang and Ting Wu and Fei Jie and Xiemin Huang and Zhifang Cai and Junhua Cheng and Shuwei Wang and Wei Li and Xiaoming Bao and Hua Xu and Shixiong Zhao and Jun Li and Hongwei Sun and Ziyang Zhang and Yi Xiong and Chunsheng Li},
journal= {arXiv preprint arXiv:2509.03047},
year = {2025}
}