Endor:面向卸载推理的 LLM 稀疏格式
计算与语言
2024-06-18 v1
摘要
大型语言模型(LLM)的规模不断增大,挑战了其在资源受限平台上的使用。例如,现代 GPU 的内存不足以容纳数百 GB 大小的 LLM。卸载是一种流行的方法,通过将 LLM 模型的权重存储到主机 CPU 内存和 SSD 中,在每次使用前将其加载到 GPU,从而规避这一限制。在我们的卸载推理案例研究中,我们发现由于存储设备与 GPU 之间的带宽较低,大规模模型权重从卸载位置传输到 GPU 内存的延迟成为关键瓶颈,而实际计算几乎占用 0% 的运行时间。为有效减少权重传输延迟,我们提出一种新颖的稀疏格式,将被剪枝 LLM 权重的非结构化稀疏模式压缩为非零值,同时保持高压缩比和低解压开销。Endor 通过以位图形式表达非零元素的位置来实现这一目标。相较于使用流行的 Huggingface Accelerate 进行卸载推理,应用 Endor 可将 OPT-66B 加速 1.70 倍,将 Llama2-70B 加速 1.78 倍。当直接利用 SSD 到 GPU 的权重传输时,Endor 在 OPT-66B 上实现 2.25 倍加速,在 Llama2-70B 上实现 2.37 倍加速。
引用
@article{arxiv.2406.11674,
title = {Endor: Hardware-Friendly Sparse Format for Offloaded LLM Inference},
author = {Donghyeon Joo and Ramyad Hadidi and Soheil Feizi and Bahar Asgari},
journal= {arXiv preprint arXiv:2406.11674},
year = {2024}
}
备注
14 pages, 16 figures