中文

QLoRA:量化大语言模型的高效微调

机器学习 2023-05-24 v1

摘要

我们提出 QLoRA,一种高效的微调方法,其将内存占用降至足以在单个 48GB GPU 上微调 65B 参数模型,同时保持完整的 16 位微调任务性能。QLoRA 通过冻结的 4 位量化预训练语言模型将梯度反向传播至低秩适配器(LoRA)。我们命名的最佳模型族 Guanaco 在 Vicuna 基准上超越所有先前公开发布的模型,达到 ChatGPT 性能的 99.3%,而仅需在单个 GPU 上微调 24 小时。QLoRA 引入多项节省内存且不损性能的创新:(a)4 位 NormalFloat(NF4),一种对正态分布权重信息论最优的新数据类型;(b)双重量化,通过对量化常数进行量化来降低平均内存占用;(c)分页优化器以管理内存峰值。我们使用 QLoRA 微调了超过 1000 个模型,针对 8 个指令数据集、多种模型类型(LLaMA、T5)以及常规微调难以运行的模型规模(如 33B 与 65B 参数模型)提供了指令遵循与聊天机器人性能的详细分析。我们的结果表明,即使在模型小于先前 SOTA 的情况下,基于小型高质量数据集的 QLoRA 微调也能取得最先进结果。我们基于人工与 GPT-4 评估给出聊天机器人性能的详细分析,表明 GPT-4 评估是人工评估的廉价且合理的替代方案。此外,我们发现当前的聊天机器人基准不足以可信地准确评估聊天机器人的性能水平。一项精选分析展示了 Guanaco 相较 ChatGPT 的失败之处。我们发布了所有模型与代码,包括用于 4 位训练的 CUDA 内核。

关键词

引用

@article{arxiv.2305.14314,
  title  = {QLoRA: Efficient Finetuning of Quantized LLMs},
  author = {Tim Dettmers and Artidoro Pagnoni and Ari Holtzman and Luke Zettlemoyer},
  journal= {arXiv preprint arXiv:2305.14314},
  year   = {2023}
}

备注

Extended NeurIPS submission