中文

semi-PD:基于阶段级非聚合计算和统一存储的高效 LLM 服务

计算与语言 2025-04-29 v1 分布式、并行与集群计算 机器学习

摘要

现有的大型语言模型(LLM)服务系统分为两类:1)统一系统,其中 prefill 阶段与 decode 阶段位于同一 GPU 上,共享统一的计算资源与存储;2)非聚合系统,其中两个阶段分配到不同的 GPU。非聚合系统的设计解决了统一系统中的延迟干扰与复杂调度问题,但导致存储挑战,包括1)防止灵活部署的两个阶段复制权重,2)两个阶段之间的 KV cache 传输开销,3)存储不平衡导致 GPU 容量的大量浪费,以及4)由于迁移 KV cache 的困难导致的次优资源调整。这种存储效率差导致在高请求率下服务性能不佳。本文识别到非聚合系统的优势在于非聚合计算,即将计算资源分区以实现两个阶段的异步计算。因此,我们提出一种新型 LLM 服务系统 semi-PD,其特点是非聚合计算与统一存储。在 semi-PD 中,我们引入计算资源控制器以实现流式处理器(SM)级别的非聚合计算,并引入统一内存管理器来管理来自两个阶段的异步内存访问。semi-PD 具备低开销的资源调整机制,并针对服务水平目标(SLO) 实现动态分区算法以优化 SLO 实现。与最先进的系统相比,semi-PD 在更高的请求率下保持更低的延迟,将平均端到端延迟降低了 1.27-2.58 倍(DeepSeek 系列模型),并在 Llama 系列模型上实现 1.55-1.72 倍的更多请求,同时满足延迟约束。

关键词

引用

@article{arxiv.2504.19867,
  title  = {semi-PD: Towards Efficient LLM Serving via Phase-Wise Disaggregated Computation and Unified Storage},
  author = {Ke Hong and Lufang Chen and Zhong Wang and Xiuhong Li and Qiuli Mao and Jianping Ma and Chao Xiong and Guanyu Wu and Buhe Han and Guohao Dai and Yun Liang and Yu Wang},
  journal= {arXiv preprint arXiv:2504.19867},
  year   = {2025}
}

备注

18 pages, 16 figures