中文

LLM.int8():面向大规模 Transformer 的 8 位矩阵乘法

机器学习 2022-11-11 v2 人工智能

摘要

大语言模型已被广泛采用,但推理需要大量 GPU 内存。我们为 Transformer 中的前馈与注意力投影层开发了 Int8 矩阵乘法流程,将推理所需内存减半,同时保持全精度性能。使用我们的方法,一个 175B 参数的 16/32 位检查点可被加载、转换为 Int8 并立即使用而无性能下降。这是通过理解并规避 Transformer 语言模型中主导注意力与预测性能的高度系统性涌现特征的性质而实现的。为应对这些特征,我们开发了名为 LLM.int8() 的两部分量化流程。我们首先使用向量级量化,为矩阵乘法中每个内积设置独立归一化常数,以量化大部分特征。然而,对于涌现离群值,我们还引入了一种新的混合精度分解方案,将离群特征维度隔离到 16 位矩阵乘法中,同时仍有超过 99.9% 的值以 8 位相乘。使用 LLM.int8(),我们实证表明可在多达 175B 参数的 LLM 中执行推理而无任何性能下降。该结果使此类模型更易获取,例如可在配备消费级 GPU 的单台服务器上使用 OPT-175B/BLOOM。我们开源了我们的软件。

关键词

引用

@article{arxiv.2208.07339,
  title  = {LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale},
  author = {Tim Dettmers and Mike Lewis and Younes Belkada and Luke Zettlemoyer},
  journal= {arXiv preprint arXiv:2208.07339},
  year   = {2022}
}

备注

Published at NeurIPS 2022. Camera-ready version