BootSeer:分析与缓解大规模 LLM 训练中的初始化瓶颈
机器学习
2026-01-28 v2 人工智能
分布式、并行与集群计算
摘要
大型语言模型 (LLM) 已成为现代人工智能的基石,推动了自然语言处理领域的突破,并正在多模态任务中扩展涉及图像、音频和视频。与大多数计算软件一样,必须区分普通运行时性能与启动开销。以往研究聚焦于运行时性能:提高训练效率和稳定性。本 work 关注的是日益关键的训练启动开销问题:即训练任务开始执行前的延迟。在我们的训练集群中,仅凭启动开销就浪费了超过 3.5% 的 GPU 时间。本 work 提供了基于真实生产数据的 LLM 训练启动开销的首次深入特征化。我们分析了启动成本的组成部分,量化其直接影响,并检验其随作业规模的扩展方式。这些见解激发了 Bootseer 设计动机,这是一个解决三个主要启动瓶颈的系统级优化框架:(a) 容器镜像加载,(b) 运行时依赖项安装,和 (c) 模型检查点恢复。为缓解这些瓶颈,Bootseer 引入了三个技术:(a) 热块记录与预取,(b) 依赖快照,和 (c) 分条 HDFS-FUSE。Bootseer 已在生产环境中部署,并在真实 LLM 训练工作负载上进行评估,显示启动开销降低了 50%。
引用
@article{arxiv.2507.12619,
title = {BootSeer: Analyzing and Mitigating Initialization Bottlenecks in Large-Scale LLM Training},
author = {Rui Li and Xiaoyun Zhi and Jinxin Chi and Menghan Yu and Lixin Huang and Jia Zhu and Weilun Zhang and Xing Ma and Wenjia Liu and Zhicheng Zhu and Daowen Luo and Zuquan Song and Xin Yin and Chao Xiang and Shuguang Wang and Wencong Xiao and Gene Cooperman},
journal= {arXiv preprint arXiv:2507.12619},
year = {2026}
}
备注
18 pages, 14 figures