中文

MoE-CAP:稀疏混合专家系统的成本、准确率与性能基准测试

机器学习 2025-05-22 v2 分布式、并行与集群计算

摘要

稀疏混合专家(MoE)架构因其高效扩展大语言模型(LLM)的能力而日益受到青睐,但它依赖于异构的计算和内存资源。这些因素共同影响系统的成本、准确率和性能(CAP),使得权衡不可避免。现有的基准测试通常无法准确捕捉这些权衡,从而使实际部署决策复杂化。为了解决这个问题,我们引入了 MoE-CAP,一个专门为 MoE 系统设计的基准测试。我们的分析表明,在现有硬件上实现 CAP 之间的最优平衡是困难的;MoE 系统通常以牺牲第三个维度为代价来优化其中两个维度——我们将这种动态称为 MoE-CAP 权衡。为了可视化这一点,我们提出了 CAP 雷达图。我们进一步引入了稀疏感知性能指标——稀疏内存带宽利用率(S-MBU)和稀疏模型 FLOPS 利用率(S-MFU)——以实现在不同硬件平台和部署场景下对 MoE 系统进行准确的性能基准测试。

关键词

引用

@article{arxiv.2505.11415,
  title  = {MoE-CAP: Benchmarking Cost, Accuracy and Performance of Sparse Mixture-of-Experts Systems},
  author = {Yinsicheng Jiang and Yao Fu and Yeqi Huang and Ping Nie and Zhan Lu and Leyang Xue and Congjie He and Man-Kit Sit and Jilong Xue and Li Dong and Ziming Miao and Dayou Du and Tairan Xu and Kai Zou and Edoardo Ponti and Luo Mai},
  journal= {arXiv preprint arXiv:2505.11415},
  year   = {2025}
}

备注

Duplicate submission of arXiv:2412.07067