FLAME-MoE:面向混合专家语言模型的透明端到端研究平台
计算与语言
2025-05-27 v1 机器学习
摘要
近期的大语言模型(如 Gemini-1.5、DeepSeek-V3 和 Llama-4)日益采用混合专家架构,该架构通过每个 token 仅激活部分模型,提供了高效的性能与效率折衷。然而,学术研究人员仍然缺乏一个完全开放的端到端 MoE 平台来研究缩放、路由和专家行为。我们发布了 FLAME-MoE,这是一个完全开源的研究套件,由七个 decoder-only 模型组成,参数量从 38M 到 1.7B 活跃参数不等,其架构——64 个专家采用 top-8 门控和 2 个共享专家——紧密反映了现代生产级 LLM。所有训练数据流水线、脚本、日志和检查点均公开可用,以支持可复现的实验。在六项评估任务中,与在相同 FLOPs 下训练的稠密基线相比,FLAME-MoE 的平均准确率最高提升 3.4 个百分点。利用完整的训练轨迹透明性,我们给出了初步分析,表明: 专家在特定 token 子集上日益专门化; 共激活矩阵保持稀疏,反映了专家使用的多样性; 路由行为在训练早期即趋于稳定。所有代码、训练日志和模型检查点可在 https://github.com/cmu-flame/FLAME-MoE 获取。
引用
@article{arxiv.2505.20225,
title = {FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models},
author = {Hao Kang and Zichun Yu and Chenyan Xiong},
journal= {arXiv preprint arXiv:2505.20225},
year = {2025}
}
备注
All code, training logs, and model checkpoints are available at https://github.com/cmu-flame/FLAME-MoE