中文

LowRA:低于 2 位的高精度 LoRA 微调

机器学习 2025-02-13 v1 硬件体系结构 计算与语言 性能

摘要

随着模型参数规模扩展到数千亿甚至上万亿,微调大型语言模型(LLM)的成本日益增加,即使是参数高效微调(PEFT)方法如 LoRA 也仍需大量资源。我们提出 LowRA,这是第一个实现低于 2 位/参数微调且性能损失最小的框架。LowRA 对粒粒度量化进行优化——包括映射、阈值选择和精度分配——并利用高效 CUDA 内核实现可扩展部署。广泛的评估在 4 个 LLM 和 4 个数据集上表明,LowRA 在 2 位以上实现卓越的性能-精度权衡,并能保持准确性降至 1.15 位,降低内存使用最高可达 50%。我们的结果凸显了在资源受限环境中进行超低比特 LoRA 微调的潜力。

关键词

引用

@article{arxiv.2502.08141,
  title  = {LowRA: Accurate and Efficient LoRA Fine-Tuning of LLMs under 2 Bits},
  author = {Zikai Zhou and Qizheng Zhang and Hermann Kumbong and Kunle Olukotun},
  journal= {arXiv preprint arXiv:2502.08141},
  year   = {2025}
}