中文

潜在原型路由:在 混合专家模型中实现接近完美的负载均衡

机器学习 2025-06-27 v1 计算与语言

摘要

混合专家 (MoE) 架构已成为高效扩展大型语言模型 (LLM) 的关键策略。然而,当前的 MoE 系统存在严重的负载不平衡问题,其中仅有一小部分专家在训练和推理期间持续被激活,导致模型容量和计算资源的显著未被充分利用。本文通过一种聚类视角重新审视专家路由,提出一种新颖的路由框架称为潜在原型路由 (LPR),该框架在促进专家利用的平衡性方面概括了现有方法,同时不损害下游性能。我们在多个开源 MoE 模型(包括 DeepSeek-V3、Qwen3-MoE 和 Mixtral)上进行了广泛实验,表明 LPR 将专家负载的基尼系数平均从 0.70 降至 0.035,改进了最小-最大专家负载比从 1e-6 提升至 0.70,实现了接近完美的负载均衡。

关键词

引用

@article{arxiv.2506.21328,
  title  = {Latent Prototype Routing: Achieving Near-Perfect Load Balancing in Mixture-of-Experts},
  author = {Jiajie Yang},
  journal= {arXiv preprint arXiv:2506.21328},
  year   = {2025}
}

备注

15 pages,4 figures