中文

MoFE:冻结专家混合架构

计算与语言 2025-03-11 v1 机器学习

摘要

我们提出了冻结专家混合(MoFE)架构,该架构集成了参数高效微调(PEFT)与专家混合(MoE)架构,以同时提升训练效率与模型可扩展性。通过在 MoE 框架中冻结前馈神经网络(FFN)层,MoFE 显著减少了可训练参数数量,在提升训练效率的同时仍允许从专家模型进行有效的知识迁移。这促进了精通多个领域的模型的创建。我们进行了实验以评估性能与效率之间的权衡,将 MoFE 与其他 PEFT 方法进行比较,评估领域专业知识在构成模型中的影响,并确定最优训练策略。结果表明,尽管在性能上可能存在一些权衡,但效率提升显著,使 MoFE 成为现实世界资源受限环境下的合理解决方案。

关键词

引用

@article{arxiv.2503.06491,
  title  = {MoFE: Mixture of Frozen Experts Architecture},
  author = {Jean Seo and Jaeyoon Kim and Hyopil Shin},
  journal= {arXiv preprint arXiv:2503.06491},
  year   = {2025}
}

备注

NAACL 2025 Industry