MoFE:冻结专家混合架构
计算与语言
2025-03-11 v1 机器学习
摘要
我们提出了冻结专家混合(MoFE)架构,该架构集成了参数高效微调(PEFT)与专家混合(MoE)架构,以同时提升训练效率与模型可扩展性。通过在 MoE 框架中冻结前馈神经网络(FFN)层,MoFE 显著减少了可训练参数数量,在提升训练效率的同时仍允许从专家模型进行有效的知识迁移。这促进了精通多个领域的模型的创建。我们进行了实验以评估性能与效率之间的权衡,将 MoFE 与其他 PEFT 方法进行比较,评估领域专业知识在构成模型中的影响,并确定最优训练策略。结果表明,尽管在性能上可能存在一些权衡,但效率提升显著,使 MoFE 成为现实世界资源受限环境下的合理解决方案。
引用
@article{arxiv.2503.06491,
title = {MoFE: Mixture of Frozen Experts Architecture},
author = {Jean Seo and Jaeyoon Kim and Hyopil Shin},
journal= {arXiv preprint arXiv:2503.06491},
year = {2025}
}
备注
NAACL 2025 Industry