NLoRA:基于 Nystr"om 初始化的低秩适应方法用于大语言模型
计算与语言
2025-02-21 v1
摘要
参数高效微调(PEFT)是适配大型语言模型(LLM)的关键技术,而低秩适应(LoRA)是最流行的方法之一。然而,LoRA 存在收敛速度慢的问题,部分最新 LoRA 变体(如 PiSSA)主要依赖奇异值分解(SVD)进行初始化,导致计算成本高昂。为缓解此问题,我们采用 Nystr"om 方法,这一方法涉及三矩阵操作。首先,我们引入结构化 LoRA(SLoRA),探讨在低秩矩阵 A 和 B 之间添加小型中间矩阵的可能性。其次,我们提出 Nystr"om LoRA(NLoRA),利用 Nystr"om 基于初始化提升 SLoRA 的有效性和效率。最后,我们提出中间调优(IntTune),探索仅在 NLoRA 中间矩阵上进行微调,以进一步提升 LLM 的效率。我们在五个自然语言生成(NLG)任务和八个自然语言理解(NLU)任务上评估了这些方法。在 GSM8K 任务上,SLoRA 和 NLoRA 的准确率分别为 56.48% 和 57.70%,均显著超越 LoRA 33.52% 和 36.41%,仅增加 367 万个可训练参数。IntTune 在 LoRA 基础上提高了 7.45% 的平均 NLG 性能,仅使用其参数的 1.25%。这些结果表明,我们的方法在保持最小参数开销的同时,有效提升了模型性能。
关键词
引用
@article{arxiv.2502.14482,
title = {NLoRA: Nystr\"om-Initiated Low-Rank Adaptation for Large Language Models},
author = {Chenlu Guo and Yuan Wu and Yi Chang},
journal= {arXiv preprint arXiv:2502.14482},
year = {2025}
}