面向资源高效大语言模型的混合与单元化参数高效微调
计算与语言
2026-01-06 v2
摘要
大语言模型(LLM)的微调由于其规模和内存需求仍是计算瓶颈。本文对参数高效微调(PEFT)技术进行全面评估,包括LoRA、BOFT、LoRA-GA和uRNN,并提出一种新颖的混合策略,动态集成BOFT的正交稳定性与LoRA-GA的梯度对齐快速收敛。通过计算基于梯度范数的逐层自适应更新,混合方法在 diverse 任务上实现了优越的收敛效率和泛化能力。我们还首次将单元化RNN(uRNN)原理应用于基于Transformer的LLM,通过结构化单元化约束增强梯度稳定性。在GLUE、GSM8K、MT-Bench和HumanEval等基准测试中,使用参数范围从7B到405B的模型,混合方法在每个任务和模型的三个独立运行中均实现一致提升,接近全参数微调的质量,同时将训练时间约减少2.1倍,将峰值内存使用降低近50%,在资源受限条件下具有实际意义。在XNLI和FLORES上的一个紧凑的多语言和低资源研究中,使用每个语言32个示例,进一步证明了在相同预算下以小且稳定的资源占用实现了一致提升。这些结果表明,在资源受限条件下,本方法提供了一条实用且可扩展的大语言模型微调之路。
引用
@article{arxiv.2507.18076,
title = {Hybrid and Unitary PEFT for Resource-Efficient Large Language Models},
author = {Haomin Qi and Zihan Dai and Chengbo Huang},
journal= {arXiv preprint arXiv:2507.18076},
year = {2026}
}
备注
11 pages, 2 figures and 7 table