中文

SVFit:利用奇异值对大型预训练模型进行参数高效微调

机器学习 2024-09-12 v1 计算与语言

摘要

大型预训练模型(LPMs)在多种自然语言处理和计算机视觉任务中展现了卓越的性能。然而,完全微调这些模型会带来巨大的内存挑战,尤其是在资源受限的环境中。参数高效微调(PEFT)方法,如LoRA,通过仅调整一小部分参数来缓解此问题。尽管如此,这些方法通常对低秩矩阵采用随机初始化,这可能导致梯度下降效率低下,并因次优的起点而降低泛化能力。为了解决这些局限性,我们提出了SVFit,这是一种新颖的PEFT方法,它利用奇异值分解(SVD)将关键的奇异值作为可训练参数来初始化低秩矩阵。具体来说,SVFit对预训练权重矩阵执行SVD以获得最佳秩r近似矩阵,强调捕获矩阵超过99%信息的最关键奇异值。然后将这些前r个奇异值用作可训练参数,以缩放矩阵的基本子空间,从而促进快速的领域适应。在自然语言理解、文本到图像生成和图像分类任务中,跨各种预训练模型进行的大量实验表明,SVFit的性能优于LoRA,同时所需的可训练参数减少了16倍。

关键词

引用

@article{arxiv.2409.05926,
  title  = {SVFit: Parameter-Efficient Fine-Tuning of Large Pre-Trained Models Using Singular Values},
  author = {Chengwei Sun and Jiwei Wei and Yujia Wu and Yiming Shi and Shiyuan He and Zeyu Ma and Ning Xie and Yang Yang},
  journal= {arXiv preprint arXiv:2409.05926},
  year   = {2024}
}