中文

DuoServe-MoE:面向 LLM 推理 QoS 保障的双阶段专家预取与缓存

分布式、并行与集群计算 2026-04-10 v2

摘要

大型语言模型(LLM)正日益作为互联网/Web服务(LLM-as-a-Service)部署,在紧张的 GPU 内存预算下具有严格的延迟服务级别目标(SLO)。混合专家模型通过稀疏专家激活提升了质量和吞吐量,但高效地为其提供服务具有挑战性,因为专家权重占据了大部分内存占用,并在卸载时产生昂贵的主机-设备传输。此外,MoE 服务表现出阶段差异:预填充阶段倾向于在多个 token 上密集激活专家,而解码阶段每步仅激活少数专家。跨阶段的统一专家加载/缓存策略会导致峰值内存激增(预填充)或尾延迟膨胀(解码)。我们提出了 DuoServe-MoE,这是一个面向 QoS 的 MoE 服务系统,它将预填充和解码分离,并应用阶段特化的专家调度。对于预填充,DuoServe-MoE 使用双流 CUDA 流水线将专家预取与非 MoE 计算重叠,从而减少专家驻留时间和峰值 GPU 内存。对于解码,它采用从激活轨迹离线训练的轻量级层级预测器,在不更改模型的情况下仅预取可能需要的专家。在代表性 MoE LLM 上的实验表明,与代表性基线相比,DuoServe-MoE 将 TTFT 提升了高达 5.34×5.34\times,将端到端延迟提升了高达 7.55×7.55\times,同时在资源受限的部署下保持了较低的运行时 GPU 内存使用量。

关键词

引用

@article{arxiv.2509.07379,
  title  = {DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance},
  author = {Yuning Zhang and Grant Pinkert and Nan Yang and Yanli Li and Dong Yuan},
  journal= {arXiv preprint arXiv:2509.07379},
  year   = {2026}
}