中文

ASLoRA:跨层自适应共享低秩微调

计算与语言 2024-12-17 v2

摘要

随着大语言模型(LLM)规模的不断增大,传统的全参数微调因其高计算和存储成本而变得越来越不可行。尽管众多参数高效微调方法(例如 LoRA)显著减少了可调参数数量,但仍有进一步优化的空间。本文提出了 ASLoRA,一种结合全局共享与部分自适应共享的跨层参数共享策略。具体而言,我们将低秩矩阵 A 在所有层之间共享,并在训练期间自适应地合并矩阵 B。这种共享机制不仅有效缓解了过拟合问题,还能捕捉跨层依赖关系,显著提升了模型的表征能力。我们在各种 NLP 任务上进行了广泛实验,表明 ASLoRA 在使用不足 LoRA 参数的 25% 的情况下便能超越 LoRA,凸显其灵活性和优异的参数效率。此外,对自适应共享策略进行的深入分析确认了其在显著提升模型灵活性和任务适应性方面的显著优势。

关键词

引用

@article{arxiv.2412.10135,
  title  = {ASLoRA: Adaptive Sharing Low-Rank Adaptation Across Layers},
  author = {Junyan Hu and Xue Xiao and Mengqi Zhang and Yao Chen and Zhaochun Ren and Zhumin Chen and Pengjie Ren},
  journal= {arXiv preprint arXiv:2412.10135},
  year   = {2024}
}