面向推理任务的混合专家语言模型的最优稀疏性
机器学习
2026-03-03 v3 人工智能
计算与语言
摘要
经验缩放定律推动了大型语言模型(LLM)的演进,但每当模型架构或数据流程发生变化时,其系数也会随之改变。混合专家模型现已成为最先进系统的标准配置,其引入了当前稠密模型前沿所忽视的新的稀疏性维度。我们研究了 MoE 稀疏性如何影响两个不同的能力范畴:记忆技能与推理技能。通过在固定计算预算下训练改变总参数量、活跃参数量与 top- 路由的 MoE 模型族,我们将预训练损失与下游准确率解耦。我们的结果揭示了两个原则。第一,活跃 FLOPs:具有相同训练损失但更大活跃计算量的模型能取得更高的推理准确率。第二,每参数总词元数(TPP):记忆任务随参数量增多而改善,而推理任务则受益于最优的 TPP,表明推理是数据饥渴的。强化学习后训练(GRPO)与增加的测试时计算均未改变这些趋势。因此我们主张,最优 MoE 稀疏性必须由活跃 FLOPs 与 TPP 共同决定,从而修正了计算最优缩放的经典图景。我们的模型检查点、代码与日志已在 https://github.com/rioyokotalab/optimal-sparsity 开源。
引用
@article{arxiv.2508.18672,
title = {Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks},
author = {Taishi Nakamura and Satoki Ishikawa and Masaki Kawamura and Takumi Okamoto and Daisuke Nohara and Jun Suzuki and Rio Yokota},
journal= {arXiv preprint arXiv:2508.18672},
year = {2026}
}
备注
Accepted as an oral at ICLR 2026