中文

Delta-LoRA:利用低秩矩阵之差微调高秩参数

机器学习 2023-09-06 v1

摘要

在本文中,我们提出 Delta-LoRA,这是一种用于微调大语言模型(LLMs)的新型参数高效方法。与 LoRA 及其他低秩自适应方法(如 AdaLoRA)不同,Delta-LoRA 不仅更新低秩矩阵 \bA\bA\bB\bB,还通过利用两个低秩矩阵乘积之差(\bA(t+1)\bB(t+1)\bA(t)\bB(t)\bA^{(t+1)}\bB^{(t+1)} - \bA^{(t)}\bB^{(t)})的更新将学习传播到预训练权重 \bW\bW。该策略有效解决了低秩矩阵的增量更新不足以学习适用于下游任务的表示的局限。此外,由于 \bW\bW 的更新无需计算其梯度并存储动量,Delta-LoRA 在内存需求和计算成本上与 LoRA 相当。大量实验表明,Delta-LoRA 显著优于现有的低秩自适应方法。我们通过全面的分析进一步支持了这些结果,突显了 Delta-LoRA 的有效性。

关键词

引用

@article{arxiv.2309.02411,
  title  = {Delta-LoRA: Fine-Tuning High-Rank Parameters with the Delta of Low-Rank Matrices},
  author = {Bojia Zi and Xianbiao Qi and Lingzhi Wang and Jianan Wang and Kam-Fai Wong and Lei Zhang},
  journal= {arXiv preprint arXiv:2309.02411},
  year   = {2023}
}