AdaServe:通过 SLO 定制投机解码加速多 SLO LLM 服务
计算与语言
2025-05-20 v2 人工智能
分布式、并行与集群计算
机器学习
摘要
现代大型语言模型(LLM)应用程序呈现出多样化的服务水平目标(SLO),从交互式编码助手中低延迟的要求,到数据处理任务中较宽松的约束。现有的LLM服务系统依赖统一的批量和调度策略,往往无法同时满足这些异构的SLO。我们提出AdaServe,这是第一个旨在通过 SLO 定制投机解码支持高效多 SLO 服务的LLM服务系统。AdaServe将多 SLO 服务建模为受约束的优化问题,并引入一种硬件感知算法,为每个请求的延迟目标构建量身的投机树。它具备一种 speculate-select-verify 流水线,能够在控制解码速度的同时最大化系统吞吐量。AdaServe还能够通过动态调整投机参数来适应工作负载的变化。跨越多样化工作负载的评估显示,AdaServe将 SLO 违规降低最高可达4.3倍,吞吐量提升最高可达1.9倍,凸显其在多 SLO 服务方面的有效性。
引用
@article{arxiv.2501.12162,
title = {AdaServe: Accelerating Multi-SLO LLM Serving with SLO-Customized Speculative Decoding},
author = {Zikun Li and Zhuofu Chen and Remi Delacourt and Gabriele Oliaro and Zeyu Wang and Qinghan Chen and Shuhuai Lin and April Yang and Zhihao Zhang and Zhuoming Chen and Sean Lai and Xinhao Cheng and Xupeng Miao and Zhihao Jia},
journal= {arXiv preprint arXiv:2501.12162},
year = {2025}
}