LLaDA-MoE:一种稀疏 MoE 扩散语言模型
计算与语言
2025-09-30 v1 人工智能
摘要
我们提出 LLaDA-MoE,一种具有混合专家(MoE)架构的大语言扩散模型,从头训练于约 20T 个 token。LLaDA-MoE 通过在推理时仅激活 1.4B 参数,在保持 7B 参数容量的同时显著降低了计算开销,实现了具有竞争力的性能。我们的实证评估表明,LLaDA-MoE 在扩散语言模型中取得了最先进的性能,参数规模更大,在多个基准测试中超越了之前的扩散语言模型 LLaDA、LLaDA 1.5 和 Dream。经过指令微调的模型 LLaDA-MoE-7B-A1B-Instruct 在知识理解、代码生成、数学推理、智能体和对齐任务方面的能力与 Qwen2.5-3B-Instruct 相当,尽管使用的激活参数更少。我们的结果表明,将稀疏 MoE 架构集成到掩码扩散语言模型的训练目标中,仍然能在少量激活参数的高效推理中发挥 MoE 的优势,并为扩散语言模型的进一步探索开辟了广阔空间。LLaDA-MoE 模型已在 Huggingface 上发布。
引用
@article{arxiv.2509.24389,
title = {LLaDA-MoE: A Sparse MoE Diffusion Language Model},
author = {Fengqi Zhu and Zebin You and Yipeng Xing and Zenan Huang and Lin Liu and Yihong Zhuang and Guoshan Lu and Kangyu Wang and Xudong Wang and Lanning Wei and Hongrui Guo and Jiaqi Hu and Wentao Ye and Tieyuan Chen and Chenchen Li and Chengfu Tang and Haibo Feng and Jun Hu and Jun Zhou and Xiaolu Zhang and Zhenzhong Lan and Junbo Zhao and Da Zheng and Chongxuan Li and Jianguo Li and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2509.24389},
year = {2025}
}