中文

POD-Attention: 解锁完整的预填充-解码重叠以实现更快的LLM推理

机器学习 2025-02-18 v2 分布式、并行与集群计算

摘要

LLM推理中的每个请求都经历两个阶段:计算受限的预填充和内存带宽受限的解码。为了提高GPU利用率,最近的系统使用混合批处理,将不同请求的预填充和解码阶段合并到同一批次中。这种方法优化了线性操作,但对于注意力计算仍然效率低下,因为现有的注意力内核专门独立执行预填充和解码阶段。在本文中,我们提出了POD-Attention——第一个能高效计算混合批次注意力的GPU内核。POD-Attention旨在通过精心分配GPU资源,使预填充和解码操作在同一多处理器上并发执行,从而最大化计算和内存带宽的利用率。与使用独立优化的预填充和解码注意力内核相比,POD-Attention将注意力计算速度提升高达59%59\%(平均28%28\%),从而实现更高吞吐量和更低延迟的LLM推理。

关键词

引用

@article{arxiv.2410.18038,
  title  = {POD-Attention: Unlocking Full Prefill-Decode Overlap for Faster LLM Inference},
  author = {Aditya K Kamath and Ramya Prabhu and Jayashree Mohan and Simon Peter and Ramachandran Ramjee and Ashish Panwar},
  journal= {arXiv preprint arXiv:2410.18038},
  year   = {2025}
}

备注

Proceedings of the 30th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 2 (ASPLOS '25), March 30 - April 3, 2025, Rotterdam, Netherlands