SCORPIO:在 LLM 推理中为异构 SLO 在正确时间服务正确请求
机器学习
2025-05-30 v1
摘要
现有大型语言模型(LLM)服务系统优先考虑最大吞吐量。它们通常忽略服务级别目标(SLO),如首字时间(TTFT)和每输出词元时间(TPOT),导致 SLO 达成率欠佳。本文介绍了 SCORPIO,一个面向 SLO 的 LLM 服务系统,旨在为具有异构 SLO 的工作负载最大化系统有效吞吐量和 SLO 达成率。我们的核心见解是利用 SLO 异构性,在准入控制、队列管理和批处理选择之间进行自适应调度。SCORPIO 包含一个 TTFT Guard,它采用最短截止期优先重排序并拒绝无法达成的请求;以及一个 TPOT Guard,它利用基于 VBS 的准入控制和新颖的基于信用的批处理机制。这两个防护均由预测模块提供支持。评估结果表明,与 SOTA 基线相比,SCORPIO 将系统有效吞吐量提高了 14.4 倍,将 SLO 依从性提高了 46.5%。
引用
@article{arxiv.2505.23022,
title = {SCORPIO: Serving the Right Requests at the Right Time for Heterogeneous SLOs in LLM Inference},
author = {Yinghao Tang and Tingfeng Lan and Xiuqi Huang and Hui Lu and Wei Chen},
journal= {arXiv preprint arXiv:2505.23022},
year = {2025}
}