中文

Fiddler:面向混合专家模型快速推理的 CPU-GPU 协同编排

机器学习 2025-05-02 v3 人工智能 分布式、并行与集群计算 操作系统

摘要

采用混合专家(MoE)架构的大语言模型(LLMs)在各种任务上展现出卓越的性能。然而,由于模型规模庞大,在 GPU 内存不充裕的资源受限环境中运行它们颇具挑战。一些现有系统提出利用 CPU 资源来解决该问题,但它们要么承受着在 CPU 和 GPU 之间频繁移动数据的显著开销,要么未能考虑 CPU 和 GPU 的独特特性。本文提出了 Fiddler,这是一个针对 GPU 资源有限的 MoE 模型的资源高效推理系统。Fiddler 通过确定最优执行策略,战略性地利用 CPU 和 GPU 资源。我们的评估表明,与针对特定场景(如单批次推理或长预填充)进行优化的最先进系统不同,Fiddler 在所有场景下均表现更佳。与不同基线相比,Fiddler 在单批次推理中实现了 1.26 倍的加速,在长预填充处理中实现了 1.30 倍的加速,在束搜索推理中实现了 11.57 倍的加速。Fiddler 的代码已在 https://github.com/efeslab/fiddler 上公开。

关键词

引用

@article{arxiv.2402.07033,
  title  = {Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models},
  author = {Keisuke Kamahori and Tian Tang and Yile Gu and Kan Zhu and Baris Kasikci},
  journal= {arXiv preprint arXiv:2402.07033},
  year   = {2025}
}

备注

ICLR2025