MoE-CAP: 稀疏混合专家系统的成本、准确性与性能基准测试
机器学习
2025-11-21 v6 分布式、并行与集群计算
摘要
稀疏混合专家(MoE)架构因能够高效扩展大型语言模型(LLM)而日益受到青睐,但它依赖于异构的计算和内存资源。这些因素共同影响系统的成本、准确性和性能(CAP),使得权衡不可避免。现有的基准测试往往无法准确捕捉这些权衡,使实际部署决策变得复杂。为此,我们引入了MoE-CAP,一个专门为MoE系统设计的基准测试。我们的分析揭示,在当前硬件上实现CAP之间的最优平衡是困难的;MoE系统通常以牺牲第三个维度为代价来优化三个维度中的两个——我们将其称为MoE-CAP权衡。为了可视化这一现象,我们提出了CAP雷达图。我们进一步引入了稀疏感知性能指标——稀疏内存带宽利用率(S-MBU)和稀疏模型FLOPS利用率(S-MFU)——以实现对MoE系统在多样化硬件平台和部署场景下的准确性能基准测试。
引用
@article{arxiv.2412.07067,
title = {MoE-CAP: Benchmarking Cost, Accuracy and Performance of Sparse Mixture-of-Experts Systems},
author = {Yinsicheng Jiang and Yao Fu and Yeqi Huang and Ping Nie and Zhan Lu and Leyang Xue and Congjie He and Man-Kit Sit and Jilong Xue and Li Dong and Ziming Miao and Dayou Du and Tairan Xu and Kai Zou and Edoardo Ponti and Luo Mai},
journal= {arXiv preprint arXiv:2412.07067},
year = {2025}
}