中文

大型语言模型微调中的稀疏矩阵

计算与语言 2025-05-20 v3

摘要

LoRA 及其变体因其能够避免过高计算成本而在参数高效微调(PEFT)方法中广受欢迎。然而,PEFT 方法与全参数微调(FT)之间常常存在准确性差距,且尚未系统研究。本文引入一种用于选择稀疏子矩阵的方法,以最小化 PEFT 与全参数微调之间的性能差距,同时降低微调计算成本和内存成本。我们的稀疏矩阵调优(Sparse Matrix Tuning, SMT)方法通过识别梯度更新中最重要的子矩阵,仅在微调过程中更新这些块。在实验中,我们展示了 SMT 在针对大型语言模型如 LLaMA 的广泛任务上始终优于其他 PEFT 基线方法(如 LoRA 和 DoRA),同时将 GPU 内存占用降低了 67%。我们还检查了 LoRA 和 DoRA 在可训练参数数量增加时性能趋于平台期并下降的现象,而 SMT 方法则不存在此问题。

关键词

引用

@article{arxiv.2405.15525,
  title  = {Sparse Matrix in Large Language Model Fine-tuning},
  author = {Haoze He and Juncheng Billy Li and Xuan Jiang and Heather Miller},
  journal= {arXiv preprint arXiv:2405.15525},
  year   = {2025}
}

备注

14 pages