中文

MoE-Inference-Bench:混合专家大语言和视觉模型的性能评估

机器学习 2025-08-26 v1 性能

摘要

混合专家 (MoE) 模型通过实现大量参数数量同时保持计算效率,使大语言模型 (LLM) 和视觉语言模型 (VLM) 的规模得以提升。然而,MoE 引入了包括专家间负载不均衡以及额外路由计算开销等多个推理时挑战。为此,我们提出了 MoE-Inference-Bench,进行系统性评估硬件加速技术。我们分析了 batch size、sequence length 以及关键 MoE 超参数(如 FFN 维度和专家数量)对吞吐量的影响。我们在 Nvidia H100 GPU 上评估了包括剪枝、Fused MoE 操作、speculative decoding、量化以及各种并行策略在内的多种优化技术。我们的评估包括来自 Mixtral、DeepSeek、OLMoE 和 Qwen 系列的 MoE。结果揭示了不同配置之间的性能差异,为 MoE 的高效部署提供了见解。

关键词

引用

@article{arxiv.2508.17467,
  title  = {MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models},
  author = {Krishna Teja Chitty-Venkata and Sylvia Howland and Golara Azar and Daria Soboleva and Natalia Vassilieva and Siddhisanket Raskar and Murali Emani and Venkatram Vishwanath},
  journal= {arXiv preprint arXiv:2508.17467},
  year   = {2025}
}

备注

Preprint