中文

Uni-LoRA:一个向量即所需

机器学习 2025-10-29 v3

摘要

低秩自适应(LoRA)通过将权重更新约束为低秩矩阵,已成为大语言模型(LLM)事实上的参数高效微调(PEFT)方法。最近的工作如 Tied-LoRA、VeRA 和 VB-LoRA 通过引入额外约束来减少可训练参数空间,进一步提升了效率。在本文中,我们表明这些 LoRA 变体所采用的参数空间缩减策略可以在一个统一框架 Uni-LoRA 内表述,其中被展平为高维向量空间 RDR^D 的 LoRA 参数空间,可以通过从子空间 R^d 的投影来重构,其中 dDd \ll D。我们证明,各种 LoRA 方法之间的根本区别在于投影矩阵 PRD×dP \in R^{D \times d} 的选择。大多数现有的 LoRA 变体依赖于逐层或特定结构的投影,这限制了跨层参数共享,从而损害了参数效率。有鉴于此,我们引入了一个高效且有理论依据的等距投影矩阵,实现了全局参数共享并减少了计算开销。此外,在 Uni-LoRA 的统一视角下,这种设计仅需一个可训练向量即可重构整个 LLM 的 LoRA 参数——这使得 Uni-LoRA 既是一个统一框架,也是一个“仅一个向量”的解决方案。在 GLUE、数学推理和指令微调基准上的大量实验表明,Uni-LoRA 实现了最先进的参数效率,同时在预测性能上优于或匹配了先前的方法。我们的代码可在 https://github.com/KaiyangLi1992/Uni-LoRA 获取。

关键词

引用

@article{arxiv.2506.00799,
  title  = {Uni-LoRA: One Vector is All You Need},
  author = {Kaiyang Li and Shaobo Han and Qing Su and Wei Li and Zhipeng Cai and Shihao Ji},
  journal= {arXiv preprint arXiv:2506.00799},
  year   = {2025}
}

备注

NeurIPS 2025 Spotlight