中文

揭秘异构LLM推理与服务的设计空间与最佳实践

分布式、并行与集群计算 2026-06-29 v1

摘要

异构预填充-解码推理现已投入生产:在成本高效或供应充足的加速器上进行预填充,在带宽强的加速器上进行解码,KV状态以混合数值格式穿越混合互连。每个部署都自行做出这些决策。所缺少的是跨配置的整体图景——哪些决策必须在PD边界联合做出,哪些可以独立做出。我们提出了一个沿四个设计轴组织的设计空间——加速器、精度、互连和KV驻留——以及它们所响应的负载状态。我们表明,一旦PD推理变得异构,这些因素之间只有一部分交互会成为约束条件。这些交互通过三个反复出现的边界决策浮现:计算放置、KV表示和KV所有权。由此产生的分析提供了具体指导。精度策略属于运行时角色,而非单一的系统级设置,因为相同的低位格式在边界两侧缓解不同的瓶颈。KV传输引擎移动字节而非张量语义,使得表示兼容性在生产者与消费者不同时成为明确的边界关注点。KV交接还带有跨越预填充和解码的生命周期预留、释放和故障恢复,需要明确的所有权。另外两个交互仍然开放。跨供应商和与互连相关的声明被表述为基于工业部署观察和相关运行时源代码检查的设计指导。

关键词

引用

@article{arxiv.2606.29708,
  title  = {Demystifying the Design Space and Best Practices for Heterogeneous LLM Inference and Serving},
  author = {Zhixin Wang and Zhengbo Wang and Fangcheng Fu and Yinhui Lu and Jinlong Hou and Yijie Chen and Xiaowei Shen and He Liu and Xiangbin Li and Jun Chen and Ruya Gu and Dian Wang and Zhou Tan and Yuan Cheng and Hongzhou Zhang and Xiangjun Huang and Ping Zhang and Xiaohe Hu},
  journal= {arXiv preprint arXiv:2606.29708},
  year   = {2026}
}