Yuan3.0 Ultra:面向企业场景的万亿参数企业级 MoE 大语言模型
机器学习
2026-03-06 v3 人工智能
计算与语言
摘要
我们提出了 Yuan3.0 Ultra,这是一个开源的混合专家(MoE)大语言模型,具备 6880 亿激活参数和 10100 亿总参数,专为增强在企业场景任务上的性能,同时保持在通用任务上的竞争能力而设计。我们提出了一种面向 MoE 大语言模型预训练阶段的 Layer-Adaptive Expert Pruning(LAEP)算法。与以往主要在后训练阶段运作的专家剪枝方法不同,所提算法通过对 token 分布统计信息有选择性地剪枝用不到的专家并根据 token 分布重新组织跨计算设备的专家,从而提升训练效率。通过全面实验表明,LAEP 有效地减少模型规模并显著提升预训练效率。当以原始 15150 亿参数从头开始预训练 Yuan3.0 Ultra 时,该算法实现了 49% 的预训练效率提升和 33.3% 的总参数降低,同时保持模型在多领域性能的卓越表现。在包括 Docmatix、ChatRAG、SummEval 和 MMTab 在内的企业场景基准测试中,Yuan3.0 Ultra 实现了领先的准确率。该模型和代码均公开于 https://github.com/Yuan-lab-LLM/Yuan3.0-Ultra。
引用
@article{arxiv.2601.14327,
title = {Yuan3.0 Ultra: A Trillion-Parameter Enterprise-Oriented MoE LLM},
author = {YuanLab. ai and : and Shawn Wu and Jiangang Luo and Darcy Chen and Sean Wang and Louie Li and Allen Wang and Xudong Zhao and Tong Yu and Bach Li and Joseph Shen and Gawain Ma and Jasper Jia and Marcus Mao and Claire Wang and Hunter He and Carol Wang and Zera Zhang and Jason Wang and Chonly Shen and Leo Zhang and Logan Chen and Qasim Meng and James Gong and Daniel Zhao and Penn Zheng and Owen Zhu},
journal= {arXiv preprint arXiv:2601.14327},
year = {2026}
}