中文

利用混合精度和多级缓存实现可持续且高效的大语言模型推理

机器学习 2024-10-24 v2 分布式、并行与集群计算

摘要

尽管大型语言模型(LLM)已展现出惊人的能力,但其庞大的参数数量和相关的大量计算使LLM的部署成为当今AI应用中主要的碳排放来源。相较于现代GPU如H100,如果能够利用如M40等较老的GPU进行LLM服务,将显著降低碳排放(如图1所示,M40仅为H100的碳排放的一三分之一)。然而,HBM(高带宽存储器)容量有限,往往无法支持LLM的加载,由于模型体积庞大和中间激活数据,使得其服务面临挑战。例如,一个700亿参数的LLaMA2模型在推理时通常需要128GB的存储,远超3090 GPU中24GB的HBM,即使考虑额外的64GB DRAM也难以实现。为解决这一挑战,本文提出一种混合精度模型模块化算法,使LLM能够在资源受限的旧硬件上进行推理。(其中,精度指表示数值精度,如FP16、INT8、INT4)以及多级缓存(M2Cache)。具体而言,M2Cache首先对LLM中的神经元进行模块化处理并创建其重要性排序。然后,它采用动态稀疏混合精度量化机制在权重空间降低每个解码步骤的计算需求和通信开销。它整体降低了LLM推理相关的运营碳排放。此外,M2Cache引入三级缓存管理系统,包括HBM、DRAM和SSD,协同支持动态稀疏混合精度推理。为提高通信效率,M2Cache在HBM中维护神经元级混合精度LRU缓存,在DRAM中维护更大的层感知缓存,在SSD中保存完整模型。

关键词

引用

@article{arxiv.2410.14740,
  title  = {Harnessing Your DRAM and SSD for Sustainable and Accessible LLM Inference with Mixed-Precision and Multi-level Caching},
  author = {Jie Peng and Zhang Cao and Huaizhi Qu and Zhengyu Zhang and Chang Guo and Yanyong Zhang and Zhichao Cao and Tianlong Chen},
  journal= {arXiv preprint arXiv:2410.14740},
  year   = {2024}
}

备注

24 pages, 13 figures