中文

PERFT: 面向混合专家模型的参数高效路由微调

机器学习 2024-11-14 v1 人工智能

摘要

混合专家(MoE)范式已成为一种强大的方法,用于扩展Transformer并改善资源利用。然而,高效微调MoE模型在很大程度上仍未得到充分探索。受近期关于参数高效微调(PEFT)工作的启发,我们提出了一个统一的框架,用于将PEFT模块直接集成到MoE机制中。与MoE的核心原则和架构一致,我们的框架包含一组设计维度,包括各种功能和组合策略。通过在我们的框架内组合设计选择,我们引入了参数高效路由微调(PERFT),作为针对MoE模型量身定制的灵活且可扩展的PEFT策略家族。在适应OLMoE-1B-7B和Mixtral-8×7B进行常识和算术推理任务上的大量实验证明了PERFT的有效性、可扩展性和有趣的动态特性。此外,我们为每个具体的设计选择提供了实证发现,以促进MoE和PEFT的更好应用。

关键词

引用

@article{arxiv.2411.08212,
  title  = {PERFT: Parameter-Efficient Routed Fine-Tuning for Mixture-of-Expert Model},
  author = {Yilun Liu and Yunpu Ma and Shuo Chen and Zifeng Ding and Bailan He and Zhen Han and Volker Tresp},
  journal= {arXiv preprint arXiv:2411.08212},
  year   = {2024}
}

备注

Code available via https://anonymous.4open.science/r/PERFT-MoE/