预训练语言模型的稀疏低秩自适应
计算与语言
2023-11-21 v1 人工智能
机器学习
摘要
以参数高效方式微调预训练大语言模型因其有效性和效率而被广泛研究。流行的低秩自适应(LoRA)方法提供了一种显著途径,其假设自适应过程本质上是低维的。尽管LoRA已展现出值得称赞的性能,但其以固定且不可更改的内蕴秩实现,可能并非总是理想选择。认识到对更灵活自适应的需求,我们将LoRA的方法扩展为一种称为稀疏低秩自适应(SoRA)的创新方法,能够在自适应过程中动态调整内蕴秩。我们通过引入在训练阶段用近端梯度法优化的门单元来实现这一点,在门的稀疏性下控制秩的基数。在后续推理阶段,我们消除对应于零化秩的参数块,将每个SoRA模块缩减回简洁而秩最优的LoRA。我们的方法通过以更高秩初始化LoRA来增强其表示能力,同时以稀疏方式更新从而高效驾驭暂时增加的参数数量。我们进一步为SoRA引入稀疏化调度器,旨在考察非零参数数量对模型记忆与泛化的影响。我们的实验结果表明,即使保留70%参数和70%训练时间,SoRA也能优于其他基线。
引用
@article{arxiv.2311.11696,
title = {Sparse Low-rank Adaptation of Pre-trained Language Models},
author = {Ning Ding and Xingtai Lv and Qiaosen Wang and Yulin Chen and Bowen Zhou and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2311.11696},
year = {2023}
}
备注
Accepted to EMNLP 2023 (Main Conference)