中文

MoE-CAP: 稀疏混合专家系统的成本、准确性与性能基准测试

机器学习 2025-11-21 v6 分布式、并行与集群计算

摘要

稀疏混合专家(MoE)架构因能够高效扩展大型语言模型(LLM)而日益受到青睐,但它依赖于异构的计算和内存资源。这些因素共同影响系统的成本、准确性和性能(CAP),使得权衡不可避免。现有的基准测试往往无法准确捕捉这些权衡,使实际部署决策变得复杂。为此,我们引入了MoE-CAP,一个专门为MoE系统设计的基准测试。我们的分析揭示,在当前硬件上实现CAP之间的最优平衡是困难的;MoE系统通常以牺牲第三个维度为代价来优化三个维度中的两个——我们将其称为MoE-CAP权衡。为了可视化这一现象,我们提出了CAP雷达图。我们进一步引入了稀疏感知性能指标——稀疏内存带宽利用率(S-MBU)和稀疏模型FLOPS利用率(S-MFU)——以实现对MoE系统在多样化硬件平台和部署场景下的准确性能基准测试。

关键词

引用

@article{arxiv.2412.07067,
  title  = {MoE-CAP: Benchmarking Cost, Accuracy and Performance of Sparse Mixture-of-Experts Systems},
  author = {Yinsicheng Jiang and Yao Fu and Yeqi Huang and Ping Nie and Zhan Lu and Leyang Xue and Congjie He and Man-Kit Sit and Jilong Xue and Li Dong and Ziming Miao and Dayou Du and Tairan Xu and Kai Zou and Edoardo Ponti and Luo Mai},
  journal= {arXiv preprint arXiv:2412.07067},
  year   = {2025}
}