中文

ReCoVer:基于容错集合与多样化工作负载的鲁棒 LLM 预训练系统

分布式、并行与集群计算 2026-05-25 v2 人工智能

摘要

在大规模 GPU 集群上进行大语言模型预训练已使硬件故障从罕见变为常态,这推动了鲁棒训练系统的需求。然而,现有框架要么专注于特定的并行方案,要么风险会偏离无故障训练轨迹。我们提出 ReCoVer,一个保持单一不变量的鲁棒 LLM 预训练系统:即每个迭代保持微批量数量不变,确保每个迭代的梯度在统计上等价于无故障运行。该框架组织为三个解耦的协议层:(1)容错集合隔离故障在复制器之间的传播;(2)步骤内细粒度恢复保留迭代内进度并防止梯度损坏;(3)多样化工作负载策略在存活者之间动态重新分配微批量配额。该设计与并行无关,可作为即插即用子系统直接集成到 3D 并行和混合分片数据并行 (HSDP) 中。我们在最高达 512 个 GPU 的端到端预训练任务上评估了实现,ReCoVer 成功在 256 个 GPU 失效(分布在整个运行期间)的情况下,保留了相对于无故障参考的训练轨迹。与 checkpoint-and-restart 基线相比,ReCoVer 在连续故障后表现出 2.23×2.23\times 的更高有效吞吐量。这种优势使得 ReCoVer 在 234 GPU 小时内处理了 74.9% 更多的 token,随着训练持续时间的增加,差距也在扩大。

关键词

引用

@article{arxiv.2605.11215,
  title  = {ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload},
  author = {Ziyue Liu and Zhengyang Wang and Ruijie Zhang and Avinash Maurya and Hui Zhou and Paul Hovland and Sheng Di and Franck Cappello and Bogdan Nicolae and Zheng Zhang},
  journal= {arXiv preprint arXiv:2605.11215},
  year   = {2026}
}

备注

Preprint