面向大语言模型低秩适配的无导数优化
计算与语言
2024-03-05 v1
摘要
参数高效微调方法(如LoRA)通过微调少量参数即可达到与模型微调相当的性能。然而,由于该过程需要计算梯度并在整个模型中进行反向传播,仍然需要大量的计算资源。最近,许多工作致力于利用无导数优化方法来避免梯度计算,并在少样本设置中展现出更强的鲁棒性。在本文中,我们将低秩模块预置到模型的每个自注意力层中,并采用两种无导数优化方法交替优化每一层的这些低秩模块。在各种任务和语言模型上的大量结果表明,在少样本设置下,与现有的基于梯度的参数高效微调方法和无导数优化方法相比,我们提出的方法实现了显著的改进,并在内存使用和收敛速度方面表现出明显优势。
引用
@article{arxiv.2403.01754,
title = {Derivative-Free Optimization for Low-Rank Adaptation in Large Language Models},
author = {Feihu Jin and Yin Liu and Ying Tan},
journal= {arXiv preprint arXiv:2403.01754},
year = {2024}
}
备注
14 pages, 4 figures, 5 tables