PiSSA:大型语言模型的主奇异值与奇异向量适配
机器学习
2025-04-10 v4 人工智能
摘要
为了对大型语言模型 (LLM) 进行参数高效微调 (PEFT),低秩适配 (LoRA) 方法通过两个矩阵 和 的乘积来近似模型变化 ,其中 , 用高斯噪声初始化, 用零初始化。LoRA 冻结原始模型 并更新“噪声与零”适配器,这可能导致收敛缓慢。为了克服这一局限性,我们引入了主奇异值与奇异向量适配 (PiSSA)。PiSSA 与 LoRA 具有相同的架构,但使用原始矩阵 的主成分初始化适配器矩阵 和 ,并将剩余成分放入在微调期间冻结的残差矩阵 中。与 LoRA 相比,PiSSA 更新主成分同时冻结“残差”部分,从而实现更快的收敛和增强的性能。在 12 个不同模型(从 184M 到 70B)上对 PiSSA 和 LoRA 进行的比较实验,涵盖 5 个 NLG 和 8 个 NLU 任务,表明在相同的实验设置下 PiSSA 始终优于 LoRA。在 GSM8K 基准上,使用 PiSSA 微调的 Mistral-7B 达到了 72.86% 的准确率,比 LoRA 的 67.7% 超出了 5.16%。由于架构相同,PiSSA 还兼容量化以进一步减少微调的内存需求。与 QLoRA 相比,QPiSSA 在初始阶段表现出更小的量化误差。在 GSM8K 上微调 LLaMA-3-70B 时,QPiSSA 达到了 86.05% 的准确率,超过了 QLoRA 的 81.73%。利用快速 SVD 技术,PiSSA 可以在几秒钟内完成初始化,从 LoRA 过渡到 PiSSA 的成本微乎其微。代码可在 https://github.com/GraphPKU/PiSSA 获取。
引用
@article{arxiv.2404.02948,
title = {PiSSA: Principal Singular Values and Singular Vectors Adaptation of Large Language Models},
author = {Fanxu Meng and Zhaohui Wang and Muhan Zhang},
journal= {arXiv preprint arXiv:2404.02948},
year = {2025}
}
备注
NeurIPS 2024 spotlight