中文

NEO:通过CPU卸载实现在线LLM推理以缓解GPU内存危机

分布式、并行与集群计算 2024-11-05 v1 人工智能 机器学习

摘要

在线LLM推理支撑着许多令人兴奋的应用,如智能聊天机器人和自主代理。现代LLM推理引擎广泛依赖请求批处理以提高推理吞吐量,旨在在昂贵的GPU加速器上运行时实现成本效益。然而,有限的GPU内存在很大程度上限制了实践中实现的批处理大小,导致大量GPU计算资源被浪费。我们提出了NEO,一个在线LLM推理系统,它将部分注意力计算和KV缓存状态从GPU卸载到本地主机CPU,有效增大了GPU批处理大小,从而提高了推理吞吐量。为此,NEO提出了非对称GPU-CPU流水线处理和负载感知调度,以平衡GPU和CPU负载并充分利用其计算和内存资源。我们在广泛的工作负载(即代码生成、文本摘要)、GPU(即T4、A10G、H100)和LLM模型(即7B、8B、70B)上评估了NEO。NEO相比纯GPU方法在T4、A10G和H100 GPU上分别实现了最高7.5倍、26%和14%的吞吐量提升,同时保持相同的延迟;配备更强大的CPU时,NEO在A10G GPU上实现了最高79.3%的吞吐量增益。

关键词

引用

@article{arxiv.2411.01142,
  title  = {NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference},
  author = {Xuanlin Jiang and Yang Zhou and Shiyi Cao and Ion Stoica and Minlan Yu},
  journal= {arXiv preprint arXiv:2411.01142},
  year   = {2024}
}