中文

INT2.1:面向可通过低秩自适应纠错的可微调量化大语言模型

计算与语言 2023-06-16 v1 人工智能 机器学习

摘要

我们提出了一种方法,可大幅降低微调时的 VRAM 需求,并纠正量化大语言模型中的量化误差。首先,我们针对量化模型使用低秩自适应(LoRA)开发了一种极高内存效率的微调(EMEF)方法,并据此构建了一种纠错算法,旨在最小化量化过程引起的误差。我们的方法将内存需求降低多达 5.6 倍,从而能够在消费级笔记本电脑上微调 70 亿参数的大语言模型(LLM)。同时,我们提出了一种低秩纠错(LREC)方法,利用所添加的 LoRA 层来缩小量化模型与其浮点对应模型之间的差距。我们的纠错框架产生了一个功能完备的 INT2 量化 LLM,能够生成连贯的英文文本。据我们所知,这是首个能够达到如此性能的 INT2 大语言模型。我们方法的开销仅为模型大小增加 1.05 倍,相当于 INT2.1 的有效精度。此外,我们的方法可轻松推广到其他量化标准,如 INT3、INT4 和 INT8,恢复它们丢失的性能,这标志着模型量化领域的一个重要里程碑。本文中阐述的策略对量化模型未来的开发和优化具有广阔前景,标志着低资源机器学习计算格局的关键转变。

关键词

引用

@article{arxiv.2306.08162,
  title  = {INT2.1: Towards Fine-Tunable Quantized Large Language Models with Error Correction through Low-Rank Adaptation},
  author = {Yuji Chai and John Gkountouras and Glenn G. Ko and David Brooks and Gu-Yeon Wei},
  journal= {arXiv preprint arXiv:2306.08162},
  year   = {2023}
}