Dynamic LLMs 的平衡与弹性端到端训练
分布式、并行与集群计算
2025-09-16 v2 人工智能
摘要
为减少大型语言模型的计算和内存开销,已提出 various 方法,包括:a) 混合专家(MoE),其中 token 路由影响计算平衡;b) 渐进式修剪模型参数;c) 动态冻结层;d) 动态稀疏注意力机制;e) token 通过模型层时的提前退出;以及f) 混合深度(MoD),其中 token 可跳过某些模块。虽然这些方法在减少总计算量方面有效,但常常会引入跨工作节点的显著工作负载不平衡。在许多情况下,这种不平衡严重到足以使这些技术在大规模分布式训练中难以实用,限制了其仅能适用于 toy 模型 due to 差労效率。我们提出了一种自主的动态负载均衡解决方案 DynMo, 可在管道并行训练中实现最大程度的工作负载不平衡减少,并自适应地在工作节点之间均衡计算负载。此外,DynMo 可在不牺牲训练吞吐量的情况下,动态地将计算合并到更少的工作节点,从而允许空闲工作节点返回作业管理器。DynMo 支持单节点多 GPU 系统和多节点 GPU 集群,可用于实际部署。与诸如 Megatron-LM 和 DeepSpeed 等静态分布式训练解决方案相比,DynMo 对动态 GPT 模型的端到端训练加速,分别对于 MoE 加快最高可达 1.23 倍,参数修剪加快 3.18 倍,层冻结加快 2.23 倍,稀疏注意力加快 4.02 倍,提前退出加快 4.52 倍,MoD 加快 1.17 倍。
引用
@article{arxiv.2505.14864,
title = {Balanced and Elastic End-to-end Training of Dynamic LLMs},
author = {Mohamed Wahib and Muhammed Abdullah Soyturk and Didem Unat},
journal= {arXiv preprint arXiv:2505.14864},
year = {2025}
}