中文

Marco-MoE:基于高效升级回收的开放多语言混合专家语言模型

计算与语言 2026-04-29 v1 人工智能

摘要

我们提出了 Marco-MoE,一套完全开放的多语言稀疏混合专家(MoE)模型。Marco-MoE 具有高度稀疏的设计,其中每个输入 token 仅激活约 5% 的总参数。这种极端的稀疏性,结合从稠密模型的升级回收,使得在 5T tokens 上的高效预训练成为可能。我们的模型在英语和多语言基准测试中超越了同等规模的竞争对手,实现了同类最佳的算力性能比。我们进一步对这些模型进行后训练,创建了 Marco-MoE-\textsc{Instruct} 变体,其性能超越了拥有 33--14×14\times 更多激活参数的竞争模型。我们的分析表明,Marco-MoE 学习了在相关语言之间共享的结构化专家激活模式,同时对语言学上孤立的语言保持了高度专业化的利用。我们进一步表明,Marco-MoE 允许可扩展的语言扩展,而不会出现稠密模型典型的干扰。为了支持社区,我们公开了我们的完整训练数据集、方案和模型权重。

关键词

引用

@article{arxiv.2604.25578,
  title  = {Marco-MoE: Open Multilingual Mixture-of-Expert Language Models with Efficient Upcycling},
  author = {Fan Jiang and Yu Zhao and Chenyang Lyu and Tianqi Shi and Yichao Du and Feihu Jiang and Longyue Wang and Weihua Luo},
  journal= {arXiv preprint arXiv:2604.25578},
  year   = {2026}
}