中文

AccelGen:面向多样化应用场景的异构 SLO 保证高吞吐 LLM 推理服务系统

计算与语言 2025-03-19 v1

摘要

本文考虑大语言模型(LLM)推理服务系统中的混合提示场景,支持包含短提示和长提示以及不同迭代时间的异构 SLO(Service Level Objective)以适应多样化应用。为提高处理长提示时的吞吐量,之前的研究引入了分块方法,但尚未解决异构 SLO 问题。为此,我们提出 AccelGen,一个为多样化应用提供异构 SLO 保证的高吞吐 LLM 推理服务系统。AccelGen 引入四个核心组件:(1)SLO 保证的动态分块,通过动态调整分块大小以最大化 GPU 计算利用率,同时满足迭代级别的 SLO;(2)基于迭代级别 SLO 的任务优先级排序,优先处理紧迫 SLO 请求并批量化相似 SLO 的请求;(3)多资源感知的批处理,挑选排队请求以最大化 GPU 计算资源和关键值缓存(KVC)的利用率。基于轨迹驱动的真实实验显示,AccelGen 相较于最新方法实现了 1.42-11.21 倍的吞吐量提升、1.43-13.71 倍的好put 提升、37%-90% 的 SLO 实现率提升以及 1.61-12.22 倍的响应延迟降低。它实现的性能接近 Oracle,即能够最优地最大化 goodput。

关键词

引用

@article{arxiv.2503.13737,
  title  = {AccelGen: Heterogeneous SLO-Guaranteed High-Throughput LLM Inference Serving for Diverse Applications},
  author = {Haiying Shen and Tanmoy Sen},
  journal= {arXiv preprint arXiv:2503.13737},
  year   = {2025}
}