中文

Ascendra:面向高效 LLM 推理的动态请求优先级调度

人工智能 2025-05-01 v2

摘要

大语言模型(LLM)的快速发展推动了更高效的推理策略需求。在此语境下,效率指的是满足其服务水平目标(SLO)的请求比例,尤其是首次标记延迟(TTFT)和标记间延迟(TBT)。然而,现有系统往往在衡量一个指标时以牺牲另一个指标为代价。我们提出Ascendra,一个旨在同时满足 TTFT 和 TBT SLO 的 LLM 推理系统。Ascendra 的核心洞察在于,请求的紧迫性会随着接近截止时间而演变。为充分利用这一点,Ascendra 将 GPU 资源划分为两种类型的实例:低优先级和高优先级。低优先级实例通过非按到达顺序处理请求来最大化吞吐量,但可能导致请求饿死。为解决此问题,Ascendra 采用性能模型预测风险缺失 SLO 的请求,并主动将其卸载到高优先级实例。高优先级实例针对低延迟执行进行优化,处理接近截止时间的紧急请求。这种分区架构使 Ascendra 能够有效平衡高吞吐量和低延迟。广泛的评估表明,与 vLLM 和 Sarathi-Serve 相比,Ascendra 在满足 TTFT 和 TBT SLO 的同时,将系统吞吐量提升最高可达 1.7 倍。

关键词

引用

@article{arxiv.2504.20828,
  title  = {Ascendra: Dynamic Request Prioritization for Efficient LLM Serving},
  author = {Azam Ikram and Xiang Li and Sameh Elnikety and Saurabh Bagchi},
  journal= {arXiv preprint arXiv:2504.20828},
  year   = {2025}
}