中文

SORSA:奇异值与正交正规化奇异向量适用于大型语言模型

机器学习 2025-05-30 v6 计算与语言

摘要

本文提出了奇异值与正交正规化奇异向量适应,或 SORSA,一种新型参数高效微调(PEFT)方法。每个 SORSA 适配器由两个主要部分组成:可训练的主奇异权重 Wp=Updiag(Sp)VpW_p = U_p \text{diag}(S_p) V^\top_p,以及冻结的残差权重 Wr=Urdiag(Sr)VrW_r = U_r \text{diag}(S_r) V^\top_r。这些部分通过对预训练权重进行奇异值分解(SVD)进行初始化。此外,我们实现并分析了一个正交正规化器,我们证明了它可以降低 WpW_p 的条件数并使优化更有效。SORSA 适配器可以在推理期间合并,从而消除任何推理延迟。我们还引入了一种方法来分析参数变化通过进行 SVD 并讨论和分析 SORSA 在最小化 SVD 方面优于 LoRA 和 PiSSA 的优势。最终,SORSA 在我们的实验中显示比 LoRA 和 PiSSA 更快的收敛。在 GSM-8K 基准测试中,使用 SORSA 适应的 Llama 2 7B 达到了 56.03% 的准确率,超越 LoRA(42.30%)和 Full FT(49.05%)。我们得出结论,SORSA 为参数高效微调提供了新的视角,显示出卓越的性能。

关键词

引用

@article{arxiv.2409.00055,
  title  = {SORSA: Singular Values and Orthonormal Regularized Singular Vectors Adaptation of Large Language Models},
  author = {Yang Cao and Zhao Song},
  journal= {arXiv preprint arXiv:2409.00055},
  year   = {2025}
}