中文

重新思考面向成本效益的 Mixture-of-Experts LLM 服务的网络拓扑结构

网络与互联网体系结构 2026-05-04 v1 人工智能

摘要

Mixture-of-experts (MoE) 架构将 LLM 服务变成集群规模的工作,在其中通信占用了相当比例的 LLM 服务运行时间。这促使行业在昂贵的高带宽 scale-up 网络上投入大量资源。我们质疑,这种昂贵的基础设施是否严格必要。我们提出首个系统化的网络成本效益交叉层面分析,用于 MoE LLM 服务,比较四种代表性 XPU(如 GPU/TPU)拓扑(scale-up、scale-out、3D torus 和 3D full-mesh)。我们发现,较低成本的无交换机拓扑在所有服务场景中均比 scale-up 拓扑更具成本效益,提高了 20.6-56.2% 的成本效益。特别是,3D full-mesh 拓扑在性能-成本权衡上达到帕累托最优。我们还发现当前的 scale-up 链路带宽被高配:降低链路带宽可提高每成本吞吐量,最高可提升 27%。对即将到来的 GPU 代际的前瞻性分析表明,无交换机网络的成本性能优势可能会持续存在。

关键词

引用

@article{arxiv.2605.00254,
  title  = {Rethinking Network Topologies for Cost-Effective Mixture-of-Experts LLM Serving},
  author = {Junsun Choi and Sam Son and Sunjin Choi and Hansung Kim and Yakun Sophia Shao and Scott Shenker and Sylvia Ratnasamy and Borivoje Nikolic},
  journal= {arXiv preprint arXiv:2605.00254},
  year   = {2026}
}