SlimQwen: 探索大规模MoE模型预训练中的剪枝与蒸馏
机器学习
2026-05-19 v2 人工智能
计算与语言
摘要
结构化剪枝和知识蒸馏是压缩大语言模型的典型技术,但它们在预训练规模下如何应用,尤其是对最近的混合专家(MoE)模型,仍不清楚。在这项工作中,我们系统地研究了大规模预训练中的MoE压缩,聚焦于三个关键问题:剪枝是否比从头训练提供更好的初始化、专家压缩选择如何影响持续训练后的最终模型、以及哪种训练策略最有效。我们有以下发现:首先,在深度、宽度和专家压缩方面,在相同训练预算下,对预训练MoE进行剪枝始终优于从头训练目标架构。其次,不同的一次性专家压缩方法在大规模持续预训练后收敛到相似的最终性能。受此启发,我们引入了一种简单的部分保留专家合并策略,该策略在大多数基准测试上提升了下游性能。第三,将知识蒸馏与语言建模损失相结合优于单独使用知识蒸馏,尤其是在知识密集型任务上。我们进一步提出了多token预测蒸馏,它带来了一致的增益。最后,在给定相同训练token的情况下,渐进式剪枝调度优于一次性压缩,这表明逐步的架构转换能带来更好的优化轨迹。综合所有这些,我们将Qwen3-Next-80A3B压缩为一个23A2B模型,该模型保持了有竞争力的性能。这些结果为大规模高效MoE压缩提供了实用指导。
引用
@article{arxiv.2605.08738,
title = {SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training},
author = {Shengkun Tang and Zekun Wang and Bo Zheng and Liangyu Wang and Rui Men and Siqi Zhang and Xiulong Yuan and Zihan Qiu and Zhiqiang Shen and Dayiheng Liu},
journal= {arXiv preprint arXiv:2605.08738},
year = {2026}
}