最小负载专家并行:处理不平衡的混合专家模型
机器学习
2026-01-27 v1 人工智能
摘要
混合专家(MoE)模型通常通过显式负载平衡约束进行预训练,以确保专家路由统计上是平衡的。尽管如此,我们观察到即使是经过充分训练的 MoE 模型也存在显著的路由不平衡。这一行为或属自然且甚至可取——不平衡的路由允许模型在少数专家中集中领域特定知识。专家并行(EP)旨在通过在多个设备上分布专家来扩展 MoE 模型,但其假设是路由平衡,这在讨论中往往被忽略。在极端不平衡情况下,EP 会将大量 token 导入少数专家,从而在后训练或推理期间导致 overloaded 设备发生计算和内存受限故障,因为此时无法应用显式负载平衡。我们提出最小负载专家并行(LLEP),一种新的 EP 算法,通过动态将 excess token 及其关联的专家参数从 overloaded 设备 reroute 到 underutilized 设备。这确保所有设备在保持内存限制的前提下,以最少的集体延迟完成工作负载。在不同模型规模下,LLEP 相较于标准 EP 实现了最高可达 5 倍的加速和 4 倍的峰值内存降低。这使得后训练和推理更快、更高效,gpt-oss-120b 约快 1.9 倍。我们通过大量理论分析和全面实证评估(包括消融研究)支持我们的 method。这些结果阐明了关键权衡,为硬件特定的超参数调优提供了原则化框架,以实现最佳性能。
引用
@article{arxiv.2601.17111,
title = {Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts},
author = {Xuan-Phi Nguyen and Shrey Pandit and Austin Xu and Caiming Xiong and Shafiq Joty},
journal= {arXiv preprint arXiv:2601.17111},
year = {2026}
}
备注
Preprint