MiLoRA:利用次要奇异分量进行参数高效的LLM微调
计算与语言
2025-03-04 v3
摘要
高效微调大型语言模型(LLM)旨在以降低的计算和内存成本适配LLM。先前的LoRA方法以高斯分布和零值初始化低秩矩阵,同时冻结原始权重矩阵。然而,优化在未引导子空间内的可训练模型参数可能干扰预训练权重矩阵中已学习的子空间。在本文中,我们提出了MiLoRA,这是一种简单而有效的LLM微调方法,仅更新权重矩阵的次要奇异分量,同时冻结主要奇异分量。观察到次要矩阵对应噪声或长尾信息,而主要矩阵包含重要知识。MiLoRA在与主要矩阵正交的子空间内初始化低秩矩阵,从而预期能良好保留预训练知识。在微调期间,MiLoRA最大化地利用较少优化子空间来学习标记数据集。在常识推理、数学推理、指令遵循和视觉指令遵循基准测试中进行了大量实验,结果表明该方法性能卓越。
引用
@article{arxiv.2406.09044,
title = {MiLoRA: Harnessing Minor Singular Components for Parameter-Efficient LLM Finetuning},
author = {Hanqing Wang and Yixia Li and Shuo Wang and Guanhua Chen and Yun Chen},
journal= {arXiv preprint arXiv:2406.09044},
year = {2025}
}
备注
This paper has been accepted at NAACL 2025. Code is available at: https://github.com/sufenlp/MiLoRA