中文

TLoRA:三矩阵低秩适配大型语言模型

机器学习 2025-12-02 v2 人工智能

摘要

我们提出了TLoRA,一种新颖的三矩阵低秩适配方法,通过将权重更新分解为三个矩阵:两个固定随机矩阵和一个可训练矩阵,并结合可学习的、层级缩放因子。这种三矩阵设计使TLoRA能够在引入最小额外计算开销的同时实现高度高效的参数适配。通过在GLUE基准上进行大量实验,我们展示了TLoRA在性能上与现有低秩方法(如LoRA和Adapter-based技术)相当,同时所需的可训练参数显著更少。分析适应动力学后,我们观察到TLoRA呈现出类似高斯的权重分布、稳定的参数范数以及跨层的缩放因子变化,进一步凸显了其表达力和适应性。此外,我们还表明TLoRA在特征值分布、参数范数以及更新余弦相似性方面与LoRA非常接近,强调了其有效近似LoRA适应行为的能力。我们的结果将TLoRA确立为大型语言模型中高效且有效的微调方法,为资源高效模型适配提供了重要的进步。

关键词

引用

@article{arxiv.2504.18735,
  title  = {TLoRA: Tri-Matrix Low-Rank Adaptation of Large Language Models},
  author = {Tanvir Islam},
  journal= {arXiv preprint arXiv:2504.18735},
  year   = {2025}
}