HyperAdaLoRA:通过超网络加速训练过程中的 LoRA 秩分配且不牺牲性能
机器学习
2025-12-15 v2 计算与语言
摘要
参数高效微调(PEFT),尤其是低秩适应(LoRA),已成为一种有前景的大语言模型(LLM)微调方法,同时降低了计算和内存开销。然而,LoRA 假设每个增量矩阵具有统一的秩 r,未考虑不同模块和层中权重矩阵的差异性重要性。AdaLoRA 利用奇异值分解(SVD)对更新进行参数化,并采用奇异值剪枝来引入动态秩分配,从而增强适应性。然而,在训练过程中,它经常遇到收敛速度慢和计算开销高的问题。为了解决这一问题,我们提出了 HyperAdaLoRA,一个通过超网络加速 AdaLoRA 收敛的新框架。HyperAdaLoRA 不直接优化奇异值分解 的各分量,而是采用基于注意力机制的超网络来动态生成这些参数。通过对生成奇异值的超网络输出进行剪枝,实现了动态秩分配。在各种数据集和模型上的全面实验表明,我们的方法在未牺牲性能的情况下实现了更快的收敛。此外,在其他基于 LoRA 的方法上的进一步扩展实验验证了我们方法的广泛适用性。
引用
@article{arxiv.2510.02630,
title = {HyperAdaLoRA: Accelerating LoRA Rank Allocation During Training via Hypernetworks without Sacrificing Performance},
author = {Hao Zhang and Zhenjia Li and Runfeng Bao and Yifan Gao and Xi Xiao and Heng Zhang and Shuyang Zhang and Bo Huang and Yuhang Wu and Tianyang Wang and Hao Xu},
journal= {arXiv preprint arXiv:2510.02630},
year = {2025}
}
备注
13 pages