中文

初始化对 LoRA 精调动态影响

机器学习 2024-06-13 v1 人工智能 计算与语言 机器学习

摘要

本文研究了在 Low Rank Adaptation (LoRA) 中的初始化方式对精调过程的影响。Hu 等人于2021年首次提出 LoRA。为了以预训练模型为精调的初始化,需采用两种方式:一种是将 B 初始化为零、A 随机初始化(PEFT 包的默认方式),另一种是反之。无论何种方式,初始化时 BA 的乘积均为零,从而使精调从预训练模型开始。这两种初始化方式看似相似,理论上应产生相同的性能并共享相同的优选学习率。我们证明了这一直觉是错误的,第一种(将 B 初始化为零、A 随机初始化)平均性能优于第二种。我们的理论分析表明,原因可能是第一种初始化方式在不导致输出不稳定的前提下,能够使用更大的学习率,从而实现更高效的学习。我们在大型语言模型上进行了大量实验以验证这些结果。

关键词

引用

@article{arxiv.2406.08447,
  title  = {The Impact of Initialization on LoRA Finetuning Dynamics},
  author = {Soufiane Hayou and Nikhil Ghosh and Bin Yu},
  journal= {arXiv preprint arXiv:2406.08447},
  year   = {2024}
}

备注

TDLR: Different Initializations lead to completely different finetuning dynamics. One initialization (set A random and B zero) is generally better than the natural opposite initialization. arXiv admin note: text overlap with arXiv:2402.12354