ModuLoRA:通过集成模块化量化器在消费级GPU上微调2比特LLM
机器学习
2024-03-12 v2 人工智能
摘要
我们提出了一种内存高效的LLM微调算法,支持在仅一块24GB GPU上以2/3/4比特精度微调参数量为65B的LLM。我们的方法——模块化低秩适配(ModuLoRA)——将任意用户指定的权重量化器通过低秩适配器(LoRA)与微调相集成。我们的方法依赖于一个简单的量化无关反向传播,从自定义黑盒量化模块自适应地实例化低精度LLM权重。该方法首次实现了2比特与3比特LLM的微调——利用了最先进的2比特QuIP#量化和3比特OPTQ量化——优于依赖较简单的4比特和8比特方法的微调。在我们的实验中,\lplora~在文本分类、自然语言推理和指令跟随任务上取得了有竞争力的性能,且内存占用显著少于现有方法,并且我们在流行的摘要任务上超越了最先进的ROUGE分数。我们发布了\lplora~以及一系列低精度模型,作为\llmtune的一部分,这是一个用于在消费级GPU上量化、运行和微调LLM的用户友好库。
引用
@article{arxiv.2309.16119,
title = {ModuLoRA: Finetuning 2-Bit LLMs on Consumer GPUs by Integrating with Modular Quantizers},
author = {Junjie Yin and Jiahao Dong and Yingheng Wang and Christopher De Sa and Volodymyr Kuleshov},
journal= {arXiv preprint arXiv:2309.16119},
year = {2024}
}
备注
Update since being accepted to TMLR. Updated 2Bit results