面向低延迟与负载均衡的 LLM 服务长度感知调度——CascadeInfer
分布式、并行与集群计算
2026-05-18 v3
摘要
高效利用 GPU 计算资源是提升用户体验和降低运营成本的关键。然而,当前推理引擎的调度器忽略了注意力后端对批次内请求长度异质性的敏感性。随着最先进模型支持超过128K token的上下文窗口,这种曾经可接受的效率损失已升级为主要系统瓶颈,导致GPU underutilization和延迟显著增加。我们提出CascadeInfer——一种动态重调度跨多个相同 LLM 服务实例的请求,以缓解单实例长度异质性。CascadeInfer 将实例划分为长度专用组,每组处理特定长度范围的请求,形成自然的流水线。CascadeInfer 采用动态规划算法高效寻找最优QoE的阶段划分,采用运行时范围细化结合去中心化负载(再)平衡,实现跨组和组内的均衡高效多实例服务。评估显示,与最先进的多实例调度系统相比,CascadeInfer 在相同配置下将端到端延迟降低最高可达67%,尾延迟降低最高可达69%,整体吞吐量提升最高可达2.89倍。
引用
@article{arxiv.2512.19179,
title = {CascadeInfer: Length-Aware Scheduling of LLM Serving with Low Latency and Load Balancing},
author = {Yitao Yuan and Chenqi Zhao and Bohan Zhao and Zane Cao and Yongchao He and Wenfei Wu},
journal= {arXiv preprint arXiv:2512.19179},
year = {2026}
}
备注
15 pages, 16 figures