中文

LoRA Land:310 个媲美 GPT-4 的微调 LLM,技术报告

计算与语言 2024-05-03 v1 人工智能 机器学习

摘要

低秩自适应(LoRA)已成为大型语言模型(LLM)参数高效微调(PEFT)最广泛采用的方法之一。LoRA 在实现与全量微调相当性能的同时,减少了可训练参数数量和内存使用。我们旨在评估在现实应用中训练和部署使用 LoRA 微调的 LLM 的可行性。首先,我们在 10 个基础模型和 31 个任务上测量了使用量化低秩适配器微调的 LLM 的质量,共计 310 个模型。我们发现,4-bit LoRA 微调模型平均比基础模型高出 34 分,比 GPT-4 高出 10 分。其次,我们研究了用于微调的最有效基础模型,并评估了任务复杂性启发式方法在预测微调结果方面的相关性和预测能力。最后,我们评估了 LoRAX 的延迟和并发能力,这是一个开源的多 LoRA 推理服务器,它通过使用共享基础模型权重和动态适配器加载,促进在单个 GPU 上部署多个 LoRA 微调模型。LoRAX 为 LoRA Land 提供支持,这是一个在配备 80GB 内存的单个 NVIDIA A100 GPU 上托管 25 个 LoRA 微调 Mistral-7B LLM 的 Web 应用程序。LoRA Land 凸显了采用多个专用 LLM 相较于单个通用 LLM 的质量和成本效益。

关键词

引用

@article{arxiv.2405.00732,
  title  = {LoRA Land: 310 Fine-tuned LLMs that Rival GPT-4, A Technical Report},
  author = {Justin Zhao and Timothy Wang and Wael Abid and Geoffrey Angus and Arnav Garg and Jeffery Kinnison and Alex Sherstinsky and Piero Molino and Travis Addair and Devvret Rishi},
  journal= {arXiv preprint arXiv:2405.00732},
  year   = {2024}
}