中文

ByteDance 的鲁棒 LLM 训练基础设施

机器学习 2025-10-21 v4 人工智能 分布式、并行与集群计算

摘要

大语言模型 的训练规模已达到数万个 GPU,并且仍在持续扩大,从而能够更快地学习更大的模型。伴随资源规模扩大的是故障(CUDA 错误、NaN 值、作业挂起等)的频发,这对训练稳定性提出了重大挑战。任何大规模 LLM 训练基础设施都应努力实现最少的训练中断、高效的故障诊断和有效的容错能力,以实现高效的连续训练。本文提出了 ByteRobust,一个专为 LLM 鲁棒稳定训练量身定制的大规模 GPU 基础设施管理系统。它利用了 LLM 训练过程的独特性,并优先以常规方式检测和恢复故障。利用 LLM 训练的并行性和特征,ByteRobust 借助有效的数据驱动方法实现了高容量容错、快速故障定界与定位,全面保障了 LLM 任务的连续高效训练。ByteRobust 部署在生产 GPU 平台上,在 9,600 个 GPU 上为期三个月的训练作业中实现了 97% 的 ETTR。

关键词

引用

@article{arxiv.2509.16293,
  title  = {Robust LLM Training Infrastructure at ByteDance},
  author = {Borui Wan and Gaohong Liu and Zuquan Song and Jun Wang and Yun Zhang and Guangming Sheng and Shuguang Wang and Houmin Wei and Chenyuan Wang and Weiqiang Lou and Xi Yang and Mofan Zhang and Kaihua Jiang and Cheng Ren and Xiaoyun Zhi and Menghan Yu and Zhe Nan and Zhuolin Zheng and Baoquan Zhong and Qinlong Wang and Huan Yu and Jinxin Chi and Wang Zhang and Yuhan Li and Zixian Du and Sida Zhao and Yongqiang Zhang and Jingzhe Tang and Zherui Liu and Chuan Wu and Yanghua Peng and Haibin Lin and Wencong Xiao and Xin Liu and Liang Xiang},
  journal= {arXiv preprint arXiv:2509.16293},
  year   = {2025}
}