MoE-Lens:在资源受限环境下高吞吐 MoE LLM 推理的硬件极限
分布式、并行与集群计算
2025-04-15 v1 人工智能
摘要
混合专家(MoE)大型语言模型(LLM)因其稀疏激活模式,提供了一种在不按比例增加推理成本的前提下扩展语言模型的有前景的方法。然而,他们的大参数尺寸在 GPU 内存容量有限的资源受限环境中 presents deployment 挑战,因为 GPU 内存通常不足以容纳完整的模型权重。因此,典型的部署依赖于 CPU-GPU 混合执行:GPU 处理计算密集型的 GEMM 操作,而 CPU 处理相对轻量的注意力机制。这一设置引入了一个关键挑战:如何在 CPU 和 GPU 之间有效地优化资源利用?先前的工作基于范围有限的性能模型设计了系统优化。具体而言,这些模型未捕捉硬件属性与系统执行机制之间复杂的相互作用。因此,之前的方法既未识别也未实现硬件极限。本文提出了 MoE-Lens,一个通过整体性能建模为资源受限环境设计的高吞吐 MoE LLM 推理系统。我们的性能模型全面分析了各种基本系统组件,包括 CPU 内存容量、GPU 计算能力和工作负载特征,以理解 MoE 推理的理论性能上限。此外,它捕捉了系统执行机制,以识别关键硬件瓶颈并准确预测可实现的吞吐量。在我们的性能模型的指导下,MoE-Lens 引入了一个接近硬件极限的推理系统。在多样化的 MoE 模型和数据集上评估后,MoE-Lens 在平均性能上超过最新解决方案 4.6 倍(最高可达 25.5 倍),我们的理论模型在预测性能方面的平均准确率达 94%。
关键词
引用
@article{arxiv.2504.09345,
title = {MoE-Lens: Towards the Hardware Limit of High-Throughput MoE LLM Serving Under Resource Constraints},
author = {Yichao Yuan and Lin Ma and Nishil Talati},
journal= {arXiv preprint arXiv:2504.09345},
year = {2025}
}