中文

BoRA:通过块多样性实现更具表达力的低秩适应

机器学习 2025-08-12 v1

摘要

低秩适应(LoRA)是一种广泛应用于大型语言模型(LLMs)的参数高效微调(PEFT)方法。它将预训练权重矩阵 WRm×nW\in\mathbb{R}^{m\times n} 的更新近似为两个低秩矩阵 BABA 的乘积,其中 ARr×nA \in\mathbb{R}^{r\times n}BRm×r(rmin{m,n})B\in\mathbb{R}^{m\times r} (r\ll\min\{m,n\})。增加维度 rr 可以提高LoRA权重(即 BABA)的秩,这通常会改善微调性能,但也会显著增加可训练参数的数量。在本文中,我们提出了块分集低秩适应(BoRA),它通过少量额外参数来提高LoRA权重的秩。具体来说,BoRA将乘积 BABA 视为块矩阵乘法,其中 AABB 分别沿列和行划分为 bb 个块(即 A=[A1,,Ab]A=[A_1,\dots,A_b]B=[B1,,Bb]B=[B_1,\dots,B_b]^\top)。因此,乘积 BABA 变为块乘积 BiAjB_iA_j(对于 i,j[b]i,j\in[b])的拼接。为了增强不同块乘积的多样性,BoRA为每个块乘法引入一个唯一的对角矩阵 Σi,jRr×r\Sigma_{i,j} \in \mathbb{R}^{r\times r},从而得到 BiΣi,jAjB_i \Sigma_{i,j} A_j。通过利用这些逐块对角矩阵,BoRA将LoRA权重的秩提高了 bb 倍,而仅需要 b2rb^2r 个额外参数。在多个数据集和模型上的大量实验证明了BoRA的优越性,消融研究进一步验证了其可扩展性。

关键词

引用

@article{arxiv.2508.06953,
  title  = {BoRA: Towards More Expressive Low-Rank Adaptation with Block Diversity},
  author = {Shiwei Li and Xiandi Luo and Haozhao Wang and Xing Tang and Ziqiang Cui and Dugang Liu and Yuhua Li and Xiuqiang He and Ruixuan Li},
  journal= {arXiv preprint arXiv:2508.06953},
  year   = {2025}
}