中文

Mélange:利用 GPU 异构性实现成本效益高的大型语言模型服务

分布式、并行与集群计算 2024-07-23 v4 机器学习

摘要

大型语言模型(LLM)日益集成到许多在线服务中,但由于需要昂贵的 GPU 实例,仍难以部署。以往的工作通过改进推理引擎来解决 LLM 服务的高成本问题,但较少关注为特定 LLM 服务选择最具成本效益的 GPU 类型。GPU 类型呈现出广泛而增长的格局,且在这些选项中,成本更高并不一定导致性能提升。相反,通过全面调查,我们发现三种关键 LLM 服务特性(请求大小、请求速率、SLO)强烈影响 GPU 的成本效益,而不同 GPU 类型在不同 LLM 服务设置下最具成本效益。因此,针对给定服务的最具成本效益的分配通常是混合异构 GPU 类型的组合。基于这一分析,我们引入 Mélange,一个 GPU 分配框架,能够导航这些多样化的 LLM 服务特性和异构 GPU 选项空间,自动且高效地推导出给定 LLM 服务的最小成本 GPU 分配。我们将 GPU 分配任务 Formulation as a cost-aware bin packing problem where GPUs are bins and items are slices of the service workload.我们的 Formulation 的约束条件考虑了服务的独特性,使 Mélange 能够灵活支持多种服务设置,并具备对 GPU 异构性的感知,以适应特定服务的分配。相较于仅使用单一 GPU 类型,Mélange 在对话场景中将部署成本降低最高 77%,在文档场景中降低 33%,在混合场景中降低 51%。

关键词

引用

@article{arxiv.2404.14527,
  title  = {M\'elange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity},
  author = {Tyler Griggs and Xiaoxuan Liu and Jiaxiang Yu and Doyoung Kim and Wei-Lin Chiang and Alvin Cheung and Ion Stoica},
  journal= {arXiv preprint arXiv:2404.14527},
  year   = {2024}
}