中文

集群拓扑驱动的专家放置减少 MoE 推理中的网络流量

网络与互联网体系结构 2025-08-14 v1 人工智能 分布式、并行与集群计算

摘要

将预训练 LLM 高效部署到具有多台服务器的集群是向用户查询提供快速响应的关键步骤。MoE LLM 的近期成功引发了如何考虑其底层结构进行高效部署的问题。在 MoE LLM 的推理过程中,只有一小部分专家被选择来处理给定的 token。此外,在实践中,专家的负载高度不平衡。为了高效部署,必须使用模型放置算法将模型分布在大量服务器上。因此,为了提高集群利用率,模型放置算法必须考虑网络拓扑。本工作专注于在推理阶段对预训练 MoE LLM 进行高效的拓扑感知放置。我们提出了一个整数线性规划(ILP),用于确定专家的最优放置,最小化预期传输次数。由于其内部结构,这个优化问题可以用标准 ILP 求解器求解。我们证明,对于小规模(DeepSeekMoE~16B)和大规模(DeepSeek-R1~671B)模型,基于 ILP 的放置策略产生的网络流量低于竞争方法。

关键词

引用

@article{arxiv.2508.09229,
  title  = {Cluster Topology-Driven Placement of Experts Reduces Network Traffic in MoE Inference},
  author = {Danil Sivtsov and Aleksandr Katrutsa and Ivan Oseledets},
  journal= {arXiv preprint arXiv:2508.09229},
  year   = {2025}
}