Pie:为 LLM 推理池化 CPU 内存
机器学习
2024-11-15 v1 分布式、并行与集群计算
摘要
LLM 的快速发展彻底改变了自然语言处理和 AI 分析,但其不断增大的规模和内存需求带来了重大挑战。一种常见的解决方案是溢出到 CPU 内存;然而,传统的 GPU-CPU 内存交换通常会导致更高的延迟和更低的吞吐量。本文介绍了 Pie,这是一个 LLM 推理框架,通过性能透明的交换和自适应扩展来解决这些挑战。通过利用可预测的内存访问模式以及现代硬件(如 NVIDIA GH200 Grace Hopper Superchip)的高带宽,Pie 能够在不影响前台计算的情况下进行并发数据交换,在不增加延迟的前提下扩展有效内存。自适应扩展根据实时信息动态调整 CPU 内存分配,优化不同条件下的内存使用和性能。Pie 保持了低计算延迟、高吞吐量和高弹性。我们的实验评估表明,Pie 在缓存预热期间实现了最优交换策略,并在有效平衡增加的内存容量的同时对计算的影响微乎其微。凭借其扩展的容量,Pie 在吞吐量上比 vLLM 高达 1.9 倍,在延迟上快 2 倍。此外,Pie 可以在保持相同性能的同时,将 GPU 内存使用量减少高达 1.67 倍。与基于离线分析的交换解决方案 FlexGen 相比,Pie 实现了数量级更低的延迟和 9.4 倍更高的吞吐量。
引用
@article{arxiv.2411.09317,
title = {Pie: Pooling CPU Memory for LLM Inference},
author = {Yi Xu and Ziming Mao and Xiangxi Mo and Shu Liu and Ion Stoica},
journal= {arXiv preprint arXiv:2411.09317},
year = {2024}
}