面向 HPC 平台的 X-MoE:为新兴 Mixture-of-Experts 架构提供可扩展训练
机器学习
2025-08-20 v1 计算与语言
分布式、并行与集群计算
摘要
新兴的专家专门的混合专家(MoE)架构,如 DeepSeek-MoE,通过细粒度专家分割和大型 top-k 路由提供了强大的模型质量,但其可扩展性受到显著的激活内存开销和高昂的 all-to-all 通信限制。此外,当前的 MoE 训练系统——主要为 NVIDIA GPU 优化——在非 NVIDIA 平台上性能次优,留下了大量计算潜力未被开发。本文提出了 X-MoE,一种新的 MoE 训练系统,旨在为下一代 MoE 架构提供可扩展的训练性能。X-MoE 通过包括高效的无填充 MoE 训练、跨平台内核、冗余旁路调度以及序列分片 MoE 块的混合并行等多项新技术实现了这一目标。我们在运作 AMD MI250X GPU 的Frontier超级计算机上进行评估,显示 X-MoE 可将 DeepSeek 风格的 MoE 扩展至 5450 亿参数跨 1024 个 GPU——在相同硬件预算下比现有方法可训练的最大模型大 10 倍,同时保持高训练吞吐量。X-MoE的源码已公开于 https://github.com/Supercomputing-System-AI-Lab/X-MoE。
引用
@article{arxiv.2508.13337,
title = {X-MoE: Enabling Scalable Training for Emerging Mixture-of-Experts Architectures on HPC Platforms},
author = {Yueming Yuan and Ahan Gupta and Jianping Li and Sajal Dash and Feiyi Wang and Minjia Zhang},
journal= {arXiv preprint arXiv:2508.13337},
year = {2025}
}
备注
17 pages, 20 figures. To be published in SC 2025