中文

LoRTA:大型语言模型的低秩张量适应

计算与语言 2025-02-04 v3 人工智能

摘要

低秩适应(LoRA)是一种流行的参数高效微调(PEFT)方法,能够有效地为下游任务调整大型预训练模型。LoRA 通过在每一层使用低秩矩阵对模型更新进行参数化,从而显著减少微调期间可训练参数的数量,从而降低资源需求。然而,由于采用低秩矩阵模型,仍存在一定可训练参数的最低下界。近期研究通过提出低秩张量参数化方案来克服这一限制,但仅利用跨层冗余,或采用不成熟的方案对单个矩阵进行张量化,引入额外超参数。在本文中,我们提出一种更高阶的 Candecomp/Parafac(CP)分解,使其在现有基于矩阵和张量的 PEFT 方法中实现更紧凑且更灵活的表示。我们在自然语言理解、指令调优、偏好优化和蛋白质折叠基准测试中进行实验,表明该方法可在保持相当性能的同时实现参数数量的降低。

关键词

引用

@article{arxiv.2410.04060,
  title  = {LoRTA: Low Rank Tensor Adaptation of Large Language Models},
  author = {Ignacio Hounie and Charilaos Kanatsoulis and Arnuv Tandon and Alejandro Ribeiro},
  journal= {arXiv preprint arXiv:2410.04060},
  year   = {2025}
}