HybridEP:通过混合专家/数据传输扩展跨数据中心场景下的专家并行
分布式、并行与集群计算
2025-10-23 v1 人工智能
机器学习
摘要
混合专家 (MoE) 已成为扩缩大型模型的流行架构。然而,规模的快速增长超出了单个数据中心内模型训练的能力,推动了向更灵活的跨数据中心训练范式的转变。在此基础上,专家并行 (EP) 由于受限于跨数据中心带宽,面临着显著的可扩展性问题。具体而言,现有的 EP 优化尝试重叠数据通信与计算,但在低带宽场景下因数据通信时间远长于计算时间,这种做法几乎没有什么益处。因此,跨数据中心 EP 的扩展趋势正迅速成为限制 MoE 模型持续增长的关键瓶颈。为此,我们提出 HybridEP,一个受建模指导的框架,用于在受限带宽下的 EP 优化。我们的核心思想是动态转换专家的空间布局,以减少数据通信流量和频率,从而最小化 EP 的通信开销。然而,要找到最优解却并非易事,因为这会通过混合数据与专家通信而复杂化原始的通信模式。我们因此构建一种基于流的模型,以确定最优传输比例。在此指导下,我们引入两种技术:(1) 基于域的分区用于在 GPU 级别之间构建混合模式与特定通信拓扑的映射,以及 (2) 参数高效的迁移用于通过减少专家传输开销和扩大域大小来进一步细化此拓扑。通过整合所有这些设计,HybridEP 可被视为一个更通用的 EP,具备更好的可扩展性。实验结果表明,在受限带宽条件下,HybridEP 相较于现有最先进的 MoE 训练系统性能提升最高可达 5.6 倍。我们进一步比较了 HybridEP 与 EP 在大规模模拟中的表现。HybridEP 在不同带宽下,1000 个数据中心的加速比最高可达 1.45 倍。
引用
@article{arxiv.2510.19470,
title = {HybridEP: Scaling Expert Parallelism to Cross-Datacenter Scenario via Hybrid Expert/Data Transmission},
author = {Weihao Yang and Hao Huang and Donglei Wu and Ningke Li and Yanqi Pan and Qiyang Zheng and Wen Xia and Shiyi Li and Qiang Wang},
journal= {arXiv preprint arXiv:2510.19470},
year = {2025}
}