SORSA:奇异值与正交正规化奇异向量适用于大型语言模型
机器学习
2025-05-30 v6 计算与语言
摘要
本文提出了奇异值与正交正规化奇异向量适应,或 SORSA,一种新型参数高效微调(PEFT)方法。每个 SORSA 适配器由两个主要部分组成:可训练的主奇异权重 ,以及冻结的残差权重 。这些部分通过对预训练权重进行奇异值分解(SVD)进行初始化。此外,我们实现并分析了一个正交正规化器,我们证明了它可以降低 的条件数并使优化更有效。SORSA 适配器可以在推理期间合并,从而消除任何推理延迟。我们还引入了一种方法来分析参数变化通过进行 SVD 并讨论和分析 SORSA 在最小化 SVD 方面优于 LoRA 和 PiSSA 的优势。最终,SORSA 在我们的实验中显示比 LoRA 和 PiSSA 更快的收敛。在 GSM-8K 基准测试中,使用 SORSA 适应的 Llama 2 7B 达到了 56.03% 的准确率,超越 LoRA(42.30%)和 Full FT(49.05%)。我们得出结论,SORSA 为参数高效微调提供了新的视角,显示出卓越的性能。
引用
@article{arxiv.2409.00055,
title = {SORSA: Singular Values and Orthonormal Regularized Singular Vectors Adaptation of Large Language Models},
author = {Yang Cao and Zhao Song},
journal= {arXiv preprint arXiv:2409.00055},
year = {2025}
}