中文

TEQ:面向大模型量化的可训练等价变换

计算与语言 2023-10-18 v1

摘要

随着大语言模型(LLMs)日益普及,对能够满足这些现代架构计算需求同时保持精度的新颖且改进的量化方法的需求不断增长。本文提出 TEQ,一种可训练等价变换,其在利用低精度量化(尤其是 3 和 4 比特仅权重量化)的同时,保持模型输出的 FP32 精度。训练过程轻量,仅需 1K 步且可训练参数少于原始模型的 0.1%。此外,该变换在推理时不引入任何计算开销。我们的结果在典型 LLM 上与最先进(SOTA)方法相当。我们的方法可与其他方法结合以实现更佳性能。代码见 https://github.com/intel/neural-compressor。

关键词

引用

@article{arxiv.2310.10944,
  title  = {TEQ: Trainable Equivalent Transformation for Quantization of LLMs},
  author = {Wenhua Cheng and Yiyang Cai and Kaokao Lv and Haihao Shen},
  journal= {arXiv preprint arXiv:2310.10944},
  year   = {2023}
}

备注

10 pages, 3 figures