TeRA:基于向量的随机张量网络用于大语言模型的高秩适配
机器学习
2026-04-15 v2
摘要
参数高效微调(PEFT)方法,如低秩适配(LoRA),显著降低了微调大语言模型(LLM)所需的可训练参数数量。LoRA风格适配器的研究主要考虑了两个方向:(1)利用高秩适配器增强模型表达能力;(2)追求进一步减少参数,例如基于向量的方法。然而,这些方法之间存在权衡,因为实现高秩权重更新的表达能力通常需要牺牲基于向量技术所提供的极端参数效率。为解决这一问题,我们提出了一种基于向量的随机张量网络高秩适配方法(TeRA),这是一种新颖的PEFT方法,在保持基于向量的PEFT适配器参数效率的同时实现高秩权重更新。这是通过将张量化权重更新矩阵参数化为Tucker类张量网络(TN)来实现的,其中大型随机初始化因子被冻结并在各层之间共享,而仅训练对应于因子矩阵对角元素的小型层特定缩放向量。全面的实验表明,TeRA在匹配甚至超越现有高秩适配器的同时,所需可训练参数与基于向量的方法一样少。理论分析和消融研究验证了所提TeRA方法的有效性。代码地址:https://github.com/guyuxuan9/TeRA。
引用
@article{arxiv.2509.03234,
title = {TeRA: Vector-based Random Tensor Network for High-Rank Adaptation of Large Language Models},
author = {Yuxuan Gu and Wuyang Zhou and Giorgos Iacovides and Danilo Mandic},
journal= {arXiv preprint arXiv:2509.03234},
year = {2026}
}
备注
Accepted at ACL main conference 2026. Code is available at https://github.com/guyuxuan9/TeRA