LatentMoE: 面向 FLOP 与参数效率的最优混合专家模型
机器学习
2026-01-27 v1 人工智能
摘要
混合专家(MoE)已成为许多领先开源和闭源大型语言模型的核心组件。尽管其应用广泛,但目前模型在推理成本(即每 FLOP 和每参数的准确率)是否接近最优仍不明确。本文从硬件-软件协同设计视角重新审视 MoE 架构,结合经验与理论分析。我们在不同部署场景下刻画关键性能瓶颈,涵盖离线高吞吐执行与在线延迟敏感推理。基于这些洞察,我们提出 LatentMoE—a 经过系统化设计探索并针对计算单元效率最大化而优化的新型模型架构。规模达到 950 亿参数、超过 1 万亿 token 训练 horizon 的实证设计空间探索,配合理论分析,表明 LatentMoE 在每 FLOP 和每参数的准确率方面持续优于标准 MoE 架构。凭借强劲性能,LatentMoE 架构已被采纳为旗舰级 Nemotron-3 Super 与 Ultra 模型的核心,并扩展至更大规模,包括更长的 token 序列和更大模型规模,如同行在 Nvidia et al. (arXiv:2512.20856) 中所报告的。
引用
@article{arxiv.2601.18089,
title = {LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts},
author = {Venmugil Elango and Nidhi Bhatia and Roger Waleffe and Rasoul Shafipour and Tomer Asida and Abhinav Khattar and Nave Assaf and Maximilian Golub and Joey Guman and Tiyasa Mitra and Ritchie Zhao and Ritika Borkar and Ran Zilberstein and Mostofa Patwary and Mohammad Shoeybi and Bita Rouhani},
journal= {arXiv preprint arXiv:2601.18089},
year = {2026}
}