中文

SBoRA: 具有区域权重更新的低秩适配

人工智能 2024-10-10 v3 计算与语言 机器学习

摘要

本文介绍了标准基LoRA(SBoRA),一种新颖的大语言模型参数高效微调方法,它建立在低秩适配(LoRA)和正交适配的开创性工作之上。SBoRA将可训练参数数量减少一半,或者在可训练参数数量与LoRA相似的情况下将秩提高一倍,同时提高了学习性能。通过利用正交标准基向量初始化其中一个低秩矩阵(A\mathbf{A}B\mathbf{B}),SBoRA促进了区域权重更新和内存高效的微调。这产生了两个变体,SBoRA-FA和SBoRA-FB,其中只有一个矩阵被更新,导致稀疏的更新矩阵 ΔW\mathrm{\Delta} \mathbf{W} 具有大部分为零的行或列。因此,微调后模型的大部分权重 (W0+ΔW)(\mathbf{W}_0+\mathrm{\Delta} \mathbf{W}) 与预训练权重保持不变,类似于人类大脑的模块化组织,能够高效地适应新任务。我们的实证结果表明,SBoRA-FA在各种微调任务(包括常识推理和算术推理)中优于LoRA。此外,我们评估了QSBoRA在不同规模的量化LLaMA模型上的有效性,突显了其高效适应新任务的潜力。代码可在 https://github.com/cityuhkai/SBoRA 获取。

关键词

引用

@article{arxiv.2407.05413,
  title  = {SBoRA: Low-Rank Adaptation with Regional Weight Updates},
  author = {Lai-Man Po and Yuyang Liu and Haoxuan Wu and Tianqi Zhang and Wing-Yin Yu and Zhuohan Wang and Zeyu Jiang and Kun Li},
  journal= {arXiv preprint arXiv:2407.05413},
  year   = {2024}
}

备注

16 pages, 4 figures