HFX:面向多 SLO 服务与快速扩缩的算法与系统联合设计
分布式、并行与集群计算
2026-04-27 v3 人工智能
摘要
大型语言模型(LLM)服务面临两个双重挑战:在动态多任务工作负载下满足严格的用户特定服务水平目标(SLO)同时最小化计算成本。现有方法要么依赖静态调度策略,要么仅关注单任务场景,限制了其在具有异构请求、可变提示长度和弹性扩缩需求的实际部署中的适用性。我们提出了 HFX,一个面向生产环境的 LLM 服务系统,联合优化请求调度和弹性扩缩,以满足多样化的 SLO。HFX 引入一个调度器,执行主动预算估计和优先级排序,以确保新请求和进行中的请求均能满足 SLO。HFX 还集成了一个扩缩器,支持快速的设备间(D2D)权重传输,减少冷启动延迟。此外,系统支持共置和非共置的 prefill/decode 部署,能够适应多样化的工作负载模式和云环境。通过多任务工作负载的大量实验,我们展示 HFX 在满足 SLO、降低端到端延迟和降低 NPU 成本方面,相较于最先进的系统分别提升了最高可达 4.44 倍、65.82% 和 49.81%。我们的结果凸显了 SLO 感知调度和扩缩在实际 LLM 服务中的有效性,为高效且符合 SLO 的部署提供了稳健的框架。
引用
@article{arxiv.2508.15919,
title = {HFX: Joint Design of Algorithms and Systems for Multi-SLO Serving and Fast Scaling},
author = {Zahra Yousefijamarani and Xinglu Wang and Qian Wang and Morgan Lindsay Heisler and Taha Shabani and Niloofar Gholipour and Parham Yassini and Hong Chang and Kan Chen and Qiantao Zhang and Xiaolong Bai and Jiannan Wang and Ying Xiong and Yong Zhang and Zhenan Fan},
journal= {arXiv preprint arXiv:2508.15919},
year = {2026}
}