中文

Unicron:大规模自愈合 LLM 训练的经济化方案

分布式、并行与集群计算 2024-01-08 v1 机器学习

摘要

大规模语言模型的训练在各个领域日益关键,但频繁发生的故障阻碍了这一进程,导致显著的时间和经济损失。当前基于云环境的故障恢复方法不足以解决出现的多样化和复杂场景,它们狭隘地专注于消除单个任务的停机时间,而未考虑对集群整体成本的影响。我们推出了 Unicron,这是一种专为大规模语言模型训练中的高效自愈合设计的工作负载管理器。Unicron 通过最小化集群内多个并发任务中与故障相关的成本来优化训练过程。其关键特性包括用于实时错误识别且无额外开销的带内错误检测、用于最优重新配置的动态成本感知计划生成机制,以及用于减少状态变更期间停机时间的高效过渡策略。Unicron 部署在 128-GPU 分布式集群上,显示出比最先进方法高达 1.9 倍的训练效率提升,显著降低了故障恢复成本并增强了大规模语言模型训练的可靠性。

关键词

引用

@article{arxiv.2401.00134,
  title  = {Unicron: Economizing Self-Healing LLM Training at Scale},
  author = {Tao He and Xue Li and Zhibin Wang and Kun Qian and Jingbo Xu and Wenyuan Yu and Jingren Zhou},
  journal= {arXiv preprint arXiv:2401.00134},
  year   = {2024}
}