中文

QUIK:面向生成式大语言模型端到端 4 位推理

机器学习 2023-11-03 v2

摘要

来自 GPT 系列的大语言模型 (LLMs) 已极为流行,引发了降低其推理成本以实现高效本地计算的竞赛。然而,现有工作绝大多数聚焦于仅权重量化,这能降低逐 token 生成式内存受限场景下的运行成本,却未解决批处理推理或提示处理等计算受限场景中的成本。本文中,我们解决通用量化问题,即权重与激活均应被量化。我们首次表明,对于 LLaMA、OPT 和 Falcon 等大型生成式模型,其大部分推理计算可在权重与激活均转为 4 位的情况下完成,从而实现实际加速,同时保持良好精度。我们通过一种称为 QUIK 的混合量化策略实现这一点,该策略将大部分权重和激活压缩至 4 位,同时将部分离群权重和激活保留在较高精度。我们方案的关键特征是以为计算效率为设计出发点:我们提供匹配 QUIK 格式的 GPU 核函数,具有高效的逐层运行时间,相对于 FP16 执行带来高达 3.4 倍的实际端到端吞吐提升。我们针对 OPT、LLaMA-2 和 Falcon 系列模型给出了详细研究,并首次给出结合量化与 2:4 稀疏性的准确推理实例。代码见:https://github.com/IST-DASLab/QUIK。

关键词

引用

@article{arxiv.2310.09259,
  title  = {QUIK: Towards End-to-End 4-Bit Inference on Generative Large Language Models},
  author = {Saleh Ashkboos and Ilia Markov and Elias Frantar and Tingxuan Zhong and Xincheng Wang and Jie Ren and Torsten Hoefler and Dan Alistarh},
  journal= {arXiv preprint arXiv:2310.09259},
  year   = {2023}
}

备注

16 pages