中文

PiSSA:大型语言模型的主奇异值与奇异向量适配

机器学习 2025-04-10 v4 人工智能

摘要

为了对大型语言模型 (LLM) 进行参数高效微调 (PEFT),低秩适配 (LoRA) 方法通过两个矩阵 ARm×rA \in \mathbb{R}^{m \times r}BRr×nB \in \mathbb{R}^{r \times n} 的乘积来近似模型变化 ΔWRm×n\Delta W \in \mathbb{R}^{m \times n},其中 rmin(m,n)r \ll \min(m, n)AA 用高斯噪声初始化,BB 用零初始化。LoRA 冻结原始模型 WW 并更新“噪声与零”适配器,这可能导致收敛缓慢。为了克服这一局限性,我们引入了主奇异值与奇异向量适配 (PiSSA)。PiSSA 与 LoRA 具有相同的架构,但使用原始矩阵 WW 的主成分初始化适配器矩阵 AABB,并将剩余成分放入在微调期间冻结的残差矩阵 WresRm×nW^{res} \in \mathbb{R}^{m \times n} 中。与 LoRA 相比,PiSSA 更新主成分同时冻结“残差”部分,从而实现更快的收敛和增强的性能。在 12 个不同模型(从 184M 到 70B)上对 PiSSA 和 LoRA 进行的比较实验,涵盖 5 个 NLG 和 8 个 NLU 任务,表明在相同的实验设置下 PiSSA 始终优于 LoRA。在 GSM8K 基准上,使用 PiSSA 微调的 Mistral-7B 达到了 72.86% 的准确率,比 LoRA 的 67.7% 超出了 5.16%。由于架构相同,PiSSA 还兼容量化以进一步减少微调的内存需求。与 QLoRA 相比,QPiSSA 在初始阶段表现出更小的量化误差。在 GSM8K 上微调 LLaMA-3-70B 时,QPiSSA 达到了 86.05% 的准确率,超过了 QLoRA 的 81.73%。利用快速 SVD 技术,PiSSA 可以在几秒钟内完成初始化,从 LoRA 过渡到 PiSSA 的成本微乎其微。代码可在 https://github.com/GraphPKU/PiSSA 获取。

关键词

引用

@article{arxiv.2404.02948,
  title  = {PiSSA: Principal Singular Values and Singular Vectors Adaptation of Large Language Models},
  author = {Fanxu Meng and Zhaohui Wang and Muhan Zhang},
  journal= {arXiv preprint arXiv:2404.02948},
  year   = {2025}
}

备注

NeurIPS 2024 spotlight