中文

Lazarus:面向混合专家模型的韧性与弹性训练

分布式、并行与集群计算 2025-10-27 v2 机器学习

摘要

稀疏激活的混合专家(MoE)架构日益被采纳以进一步扩展大型语言模型(LLM)。然而,频繁的故障仍是训练规模化过程中的重大挑战。即使单次故障成本也相当高昂,因为所有 GPU 都需要等待故障解决后才能空闲,潜在地丢失大量训练进度,训练必须从检查点重新启动。广泛使用公共云端点实例(spot instances)进行模型训练虽能实现显著成本节省,但引入的频繁抢占(preemption)——即在训练过程中定期发生的故障——加剧了这一问题。现有针对高效容错训练的解决方案要么缺乏弹性,要么依赖构建管道并行的韧性,这种方法无法应用于 MoE 模型,因为 MoE 架构采用专家并行策略。我们提出 Lazarus,一种用于 MoE 模型韧性与弹性训练的系统。Lazarus 自适应分配专家副本以解决专家工作负载的内在不平衡问题,同时加快训练速度;同时,我们开发了一种可证明最优的专家放置算法,以最大化故障恢复的概率。通过自适应专家放置和灵活的 token 分配器,Lazarus 还能在故障发生后完全利用所有可用节点,使 GPU 不会空闲。我们的评估显示,在频繁节点故障下,Lazarus 相较于现有 MoE 训练系统可提升最高达 5.7 倍,在真实的 spot instance 轨迹上提升最高达 3.4 倍。

关键词

引用

@article{arxiv.2407.04656,
  title  = {Lazarus: Resilient and Elastic Training of Mixture-of-Experts Models},
  author = {Yongji Wu and Wenjie Qu and Xueshen Liu and Tianyang Tao and Yifan Qiao and Zhuang Wang and Wei Bai and Yuan Tian and Jiaheng Zhang and Z. Morley Mao and Matthew Lentz and Danyang Zhuo and Ion Stoica},
  journal= {arXiv preprint arXiv:2407.04656},
  year   = {2025}
}