SiRA:低秩自适应的稀疏混合
计算与语言
2023-11-16 v1
摘要
参数高效微调已成为将大语言模型适配下游任务的显著方法。多数先前工作考虑添加稠密可训练参数,其中所有参数均用于适配特定任务。我们以 LoRA 为例发现,经验上引入更多可训练参数并无助益。受此启发,我们探究利用“稀疏”计算的重要性,并提出 SiRA:低秩自适应的稀疏混合。SiRA 利用稀疏专家混合(SMoE)来提升 LoRA 的性能。具体而言,它强制采用带容量限制的 top 专家路由,限制每个专家可处理的最大 token 数。我们在门控网络之上提出一种新颖且简单的专家丢弃以缓解过拟合问题。通过大量实验,我们验证了 SiRA 在不同单任务与多任务设定下均优于 LoRA 及其他专家混合方法。
引用
@article{arxiv.2311.09179,
title = {SiRA: Sparse Mixture of Low Rank Adaptation},
author = {Yun Zhu and Nevan Wichers and Chu-Cheng Lin and Xinyi Wang and Tianlong Chen and Lei Shu and Han Lu and Canoee Liu and Liangchen Luo and Jindong Chen and Lei Meng},
journal= {arXiv preprint arXiv:2311.09179},
year = {2023}
}