Chain of LoRA:基于残差学习的语言模型高效微调
机器学习
2024-01-10 v1 计算与语言
摘要
微调是将预训练大语言模型适配到特定任务的主要方法。随着模型规模和任务多样性的扩展,参数高效微调方法至关重要。应用最广泛的方法系列之一是低秩适应(LoRA)及其变体。LoRA将权重更新编码为两个低秩矩阵的乘积。尽管有其优势,LoRA在某些任务的泛化误差方面不及全参数微调。我们引入了Chain of LoRA(COLA),这是一种受Frank-Wolfe算法启发的迭代优化框架,旨在弥合LoRA与全参数微调之间的差距,且不产生额外的计算成本或内存开销。COLA采用残差学习过程,将学习到的LoRA模块合并到预训练语言模型参数中,并为新生成的LoRA模块重新初始化优化。我们提供了理论收敛保证以及实证结果来验证我们算法的有效性。在多种模型(OPT和llama-2)和七个基准任务上,我们证明COLA能够在不增加额外计算或内存成本的情况下持续优于LoRA。
引用
@article{arxiv.2401.04151,
title = {Chain of LoRA: Efficient Fine-tuning of Language Models via Residual Learning},
author = {Wenhan Xia and Chengwei Qin and Elad Hazan},
journal= {arXiv preprint arXiv:2401.04151},
year = {2024}
}
备注
Work in progress