中文

SpQR:一种用于近无损 LLM 权重压缩的稀疏量化表示

计算与语言 2023-06-06 v1 机器学习

摘要

大语言模型(LLM)预训练的最新进展催生了具有令人印象深刻能力的高质量 LLM。通过将此类 LLM 通过量化压缩至每参数 3-4 位,它们可装入内存受限设备(如笔记本电脑和手机),实现个性化使用。然而,量化至每参数 3-4 位通常导致中度至高度精度损失,尤其对于 1-10B 参数范围内、适合边缘部署的较小模型。为解决该精度问题,我们引入稀疏量化表示(SpQR),一种新压缩格式与量化技术,首次实现跨模型规模的 LLM 近无损压缩,同时达到与先前方法相似的压缩水平。SpQR 通过识别并隔离导致特别大量化误差的离群权重,并将其以更高精度存储,同时将其他所有权重压缩至 3-4 位,从而对高精度的 LLaMA 和 Falcon LLM 实现了困惑度相对精度损失小于 1%。这使得在单个 24 GB 消费级 GPU 上运行 33B 参数 LLM 成为可能,且无任何性能下降,并有 15% 加速,从而使强大 LLM 无代价地惠及消费者。SpQR 配有高效算法,既可将权重编码为其格式,也可在运行时高效解码。具体而言,我们提供高效的 SpQR GPU 推理算法,在以相似精度实现超过 4 倍内存压缩收益的同时,比 16 位基线推理更快。

关键词

引用

@article{arxiv.2306.03078,
  title  = {SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression},
  author = {Tim Dettmers and Ruslan Svirschevski and Vage Egiazarian and Denis Kuznedelev and Elias Frantar and Saleh Ashkboos and Alexander Borzunov and Torsten Hoefler and Dan Alistarh},
  journal= {arXiv preprint arXiv:2306.03078},
  year   = {2023}
}

备注

Extended preprint