中文

Preble:面向 LLM 推理服务的高效分布式提示调度

分布式、并行与集群计算 2024-10-04 v2 机器学习

摘要

大语言模型 (LLM) 的提示已演变为简单用户提问之外的复杂问题。为了使 LLM 能够解决复杂问题,今天的做法是包括特定领域的指令、工具用法示例以及诸如教科书章节等的长上下文。因此,许多提示的部分在不同请求中是重复的。最近的研究提出了缓存和重用 KV 状态的想法,但这些方法都局限于单 GPU 优化,而生产 LLM 推理系统本质上是分布式的。本文提出了 Preble,这是第一个面向提示共享并对其进行优化的分布式 LLM 推理平台。我们设计了一个分布式调度系统,以一种新的调度算法和层次化调度机制 co-optimizes KV 状态重用和计算负载均衡。我们使用真实工作负载和请求到达模式在两个开源 LLM 上评估 Preble,显示其在平均延迟和 p99 延迟上分别比 SOTA 系统提高了 1.5 倍到 14.5 倍和 2 倍到 10 倍。

关键词

引用

@article{arxiv.2407.00023,
  title  = {Preble: Efficient Distributed Prompt Scheduling for LLM Serving},
  author = {Vikranth Srivatsa and Zijian He and Reyna Abhyankar and Dongming Li and Yiying Zhang},
  journal= {arXiv preprint arXiv:2407.00023},
  year   = {2024}
}