Ascendra:面向高效 LLM 推理的动态请求优先级调度
人工智能
2025-05-01 v2
摘要
大语言模型(LLM)的快速发展推动了更高效的推理策略需求。在此语境下,效率指的是满足其服务水平目标(SLO)的请求比例,尤其是首次标记延迟(TTFT)和标记间延迟(TBT)。然而,现有系统往往在衡量一个指标时以牺牲另一个指标为代价。我们提出Ascendra,一个旨在同时满足 TTFT 和 TBT SLO 的 LLM 推理系统。Ascendra 的核心洞察在于,请求的紧迫性会随着接近截止时间而演变。为充分利用这一点,Ascendra 将 GPU 资源划分为两种类型的实例:低优先级和高优先级。低优先级实例通过非按到达顺序处理请求来最大化吞吐量,但可能导致请求饿死。为解决此问题,Ascendra 采用性能模型预测风险缺失 SLO 的请求,并主动将其卸载到高优先级实例。高优先级实例针对低延迟执行进行优化,处理接近截止时间的紧急请求。这种分区架构使 Ascendra 能够有效平衡高吞吐量和低延迟。广泛的评估表明,与 vLLM 和 Sarathi-Serve 相比,Ascendra 在满足 TTFT 和 TBT SLO 的同时,将系统吞吐量提升最高可达 1.7 倍。
引用
@article{arxiv.2504.20828,
title = {Ascendra: Dynamic Request Prioritization for Efficient LLM Serving},
author = {Azam Ikram and Xiang Li and Sameh Elnikety and Saurabh Bagchi},
journal= {arXiv preprint arXiv:2504.20828},
year = {2025}
}