中文

LaDiMo:基于层级蒸馏的稀疏Mixture-of-Experts模型

计算与语言 2024-08-09 v1

摘要

大型语言模型的出现 revolutionized了自然语言处理,但其日益增长的复杂性导致了巨大的训练成本、资源需求和环境影响。作为对策,稀疏Mixture-of-Experts (MoE) 模型作为密集模型的有前景的替代方案。由于从头训练MoE模型代价高昂,最近的研究探索了从预训练非MoE模型中利用知识。然而,现有方法存在局限性,如需要大量硬件资源和数据。我们提出了一种新型算法LaDiMo,能够以最小的额外训练成本,将基于Transformer的非MoE模型高效转换为MoE模型。LaDiMo包含两个阶段:层级专家构建和路由策略决策。通过运用知识蒸馏的概念,我们压缩模型并快速恢复其性能。此外,我们开发了自适应路由器,通过剖析路由权重的分布情况,确定层级策略,以平衡准确率和延迟。我们通过仅使用10万个token将LLaMA2-7B模型转换为MoE模型,激活参数降低超过20%,同时保持准确率。我们的方法提供了一个灵活且高效的构建和部署MoE模型解决方案。

关键词

引用

@article{arxiv.2408.04278,
  title  = {LaDiMo: Layer-wise Distillation Inspired MoEfier},
  author = {Sungyoon Kim and Youngjun Kim and Kihyo Moon and Minsung Jang},
  journal= {arXiv preprint arXiv:2408.04278},
  year   = {2024}
}

备注

21 pages, 10 figures