中文

权重奇异值低秩适配的双分解

计算与语言 2025-05-22 v2

摘要

参数高效微调 (PEFT) 已成为适应大型语言模型 (LLM) 到下游任务的关键范式,其中低秩适配 (LoRA) 代表了最广泛采用的 методs之一。然而,现有基于 LoRA 的方法存在两个根本局限:训练动力学不稳定且来自预训练模型的知识传递效率低下,这两者都源于适配器参数的随机初始化。为克服这些挑战,我们提出了 DuDe—a一种将权矩阵分解为幅值和方向分量的方法,采用奇异值分解 (SVD) 进行原则性初始化。我们的全面评估显示,DuDe 在 MMLU 上实现最高可达 48.35% 的准确率,在 GSM8K 上实现 62.53% (±\pm 1.59) 的准确率。我们的理论分析和实证验证共同表明,DuDe 的分解策略增强了优化稳定性,更好地保留了预训练表示,特别是对于需要专业知识的领域特定任务。robuste 实证性能与严谨的理论基础确立了 DuDe 作为大型语言模型参数高效微调方法学的重要贡献。

关键词

引用

@article{arxiv.2505.14367,
  title  = {Dual Decomposition of Weights and Singular Value Low Rank Adaptation},
  author = {Jialong Han and Si Zhang and Ke Zhang},
  journal= {arXiv preprint arXiv:2505.14367},
  year   = {2025}
}