AlphaLoRA: 基于图层训练质量分配 LoRA 专家
计算与语言
2024-10-15 v1
摘要
低秩适应(LoRA)等参数高效微调方法已被证明可增强大语言模型(LLM)的训练效率。由于 LoRA 的参数有限,近期研究寻求将 LoRA 与混合专家(Mixture-of-Experts, MoE)结合,以提升各种任务上的性能。然是,受传统 MoE 结构中冗余性观察到的启发,先前研究识别到 LoRA 专家在 MoE 架构中的类似冗余,凸显在不同图层中非均匀分配 LoRA 专家的必要性。本文利用重量尾自正则化(Heavy-Tailed Self-Regularization, HT-SR)理论设计了细粒度分配策略。我们的分析揭示,各图层专家数目与图层训练质量相关,而后者在图层之间存在显著变异。基于此,我们引入 AlphaLoRA,一种在不进行训练的情况下为进一步减轻冗余度分配 LoRA 专家的理论原则方法。在三个模型上进行十个语言处理和推理基准的实验表明,AlphaLoRA 在所有基准中实现相当或优于所有基准的性能。我们的代码已公开于 https://github.com/morelife2017/alphalora。
引用
@article{arxiv.2410.10054,
title = {AlphaLoRA: Assigning LoRA Experts Based on Layer Training Quality},
author = {Peijun Qing and Chongyang Gao and Yefan Zhou and Xingjian Diao and Yaoqing Yang and Soroush Vosoughi},
journal= {arXiv preprint arXiv:2410.10054},
year = {2024}
}
备注
The 2024 Conference on Empirical Methods in Natural Language Processing