中文

TD-Pipe: 用于高吞吐量 LLM 推理的时间解耦流水线并行架构

分布式、并行与集群计算 2025-06-13 v1

摘要

随着模型规模持续增大,流水线并行在面向吞吐量的 LLM 推理中展现出巨大前景,因其通信需求较低。然而,预填充和解码阶段之间不平衡的流水线工作负载和复杂的数据依赖导致了大量流水线气泡和进一步的严重性能下降。为更好地利用流水线并行实现高吞吐量 LLM 推理,我们提出了 TD-Pipe,其关键思想在于时间解耦的流水线并行架构。具体而言,该架构在时间维度上解耦预填充和解码阶段,以消除由阶段切换引起的流水线气泡。TD-Pipe 识别了利用该新型架构的潜在问题并提供了解决方案。首先,采用层次控制器结构,通过将调度与执行解耦来更好地协调流水线并行中的设备。其次,基于 AI 的贪心预填充方法通过预测输出长度和模拟内存使用来积极执行更多预填充。第三,批间工作窃取方法在不同批次之间动态平衡解码阶段的工作负载以减少气泡。第四,空间-时间强度比较方法通过比较计算强度降低带来的性能下降与阶段切换气泡带来的性能下降,确定从解码到预填充的最优切换时机。大量实验表明,TD-Pipe 有效将 LLM 推理吞吐量提高了最多 1.91 倍(相对于现有的张量并行方法)和 2.73 倍(相对于现有的流水线并行方法),在仅使用 PCIe 互联的 GPU 节点上。

关键词

引用

@article{arxiv.2506.10470,
  title  = {TD-Pipe: Temporally-Disaggregated Pipeline Parallelism Architecture for High-Throughput LLM Inference},
  author = {Hongbin Zhang and Taosheng Wei and Zhenyi Zheng and Jiangsu Du and Zhiguang Chen and Yutong Lu},
  journal= {arXiv preprint arXiv:2506.10470},
  year   = {2025}
}