PipeBoost:面向快速Serverless LLM扩缩的鲁棒流水线架构
量子物理
2025-04-01 v2
摘要
本文提出PipeBoost,是一个面向多GPU(serverless)集群的低时延LLM serving系统,能够在响应突发请求时快速启动推理服务,无需预先超配GPU。许多LLM推理任务依赖相同的基础模型(如LoRA)。为此,PipeBoost引入跨模型加载与推理阶段的容错流水线并行。该方法最大化PCIe带宽和跨GPU的并行计算,从而加速首个token的生成。PipeBoost还引入恢复技术,利用多个GPU的共享优势实现无中断的推理服务。实验结果表明,与当前最先进的低时延LLM serving系统相比,PipeBoost可将推理时延降低31%至49.8%。对于某些模型(如OPT-1.3B),PipeBoost的冷启动时延可在数百微秒内实现。
关键词
引用
@article{arxiv.2503.17706,
title = {Cavity QED with degenerate atomic levels and polarization-degenerate field mode},
author = {V. A. Reshetov},
journal= {arXiv preprint arXiv:2503.17706},
year = {2025}
}
备注
11 pages, 3 figures