让专家各司其职:面向稀疏架构大语言模型的专家特化微调
计算与语言
2024-07-08 v2 人工智能
机器学习
摘要
参数高效微调(PEFT)对于在资源受限下定制大语言模型(LLM)至关重要。尽管已有多种针对密集架构 LLM 的 PEFT 方法,但针对稀疏架构 LLM 的 PEFT 仍待探索。在本工作中,我们研究了针对具有混合专家架构的 LLM 的 PEFT 方法,本工作的内容主要有三个方面:(1) 我们研究了定制任务中激活专家的分散程度,发现特定任务的路由分布往往高度集中,而不同任务间激活专家的分布差异显著。(2) 我们提出了专家特化微调,即 ESFT,它仅微调与下游任务最相关的专家,同时冻结其他专家和模块;实验结果表明,我们的方法不仅提高了微调效率,而且性能匹敌甚至超越了全参数微调。(3) 我们进一步分析了 MoE 架构对专家特化微调的影响。我们发现,具有更细粒度专家的 MoE 模型在选择与下游任务最相关的专家组合方面更具优势,从而同时提升了训练效率和有效性。我们的代码可在 https://github.com/deepseek-ai/ESFT 获取。
引用
@article{arxiv.2407.01906,
title = {Let the Expert Stick to His Last: Expert-Specialized Fine-Tuning for Sparse Architectural Large Language Models},
author = {Zihan Wang and Deli Chen and Damai Dai and Runxin Xu and Zhuoshu Li and Y. Wu},
journal= {arXiv preprint arXiv:2407.01906},
year = {2024}
}