TokenScale:面向无标签 LLM 推理服务的及时且准确的自动标量扩展框架
分布式、并行与集群计算
2025-12-04 v1
摘要
无标签 LLM 推理服务中采用预填/解码(PD)解耦架构可提升资源利用率,但面对现代工作负载的突发性,仍存在性能瓶颈。现有自动标量扩展策略,往往是从单体系统(如 AIBrix 和 DistServe)移植而来,依赖 GPU 利用率或粗粒度请求计数等滞后指标,导致对负载尖峰反应迟缓,引发显著的首次标记延迟(TTFT)和标记输出时延(TPOT)服务等级目标(SLO)违规,以及高额的超额配置成本。我们提出 TokenScale,一种通过两种创新措施解决性能失衡的自动标量扩展框架。首先,我们提出令牌速度(Token Velocity)这一新颖指标,通过量化其工作速率来统一预填、网络和解码阶段的工作量。作为系统背压的领先指标,它实现主动式扩展。其次,Convertible Decoders 允许解码 GPU 在流量尖峰时动态执行预填任务,构建快速响应缓冲区,以吸收突发负载并消除新预填器的初始化延迟。我们在 GPU 集群上使用生产轨迹进行评估,显示 TokenScale 将 SLO 达成率提升至 80-96%(原 50-88%),成本降低 4-14%,显著优于 DistServe、BlitzScale 和 AIBrix 等最新系统。通过将预测性指标与灵活的系统设计统一,TokenScale 大幅提升了无标签 LLM 推理服务基础设施的性能与效率。
引用
@article{arxiv.2512.03416,
title = {TokenScale: Timely and Accurate Autoscaling for Disaggregated LLM Serving with Token Velocity},
author = {Ruiqi Lai and Hongrui Liu and Chengzhi Lu and Zonghao Liu and Siyu Cao and Siyang Shao and Yixin Zhang and Luo Mai and Dmitrii Ustiugov},
journal= {arXiv preprint arXiv:2512.03416},
year = {2025}
}