后训练 MoE 可通过自蒸馏跳过一半专家
机器学习
2026-05-19 v1 人工智能
计算与语言
摘要
Mixture-of-Experts (MoE) 通过稀疏专家激活高效地扩展语言模型,其动态变体通过以输入相关的方式调整激活的专家进一步减少了计算量。现有的动态 MoE 方法通常依赖于从零开始的预训练或特定任务的适配,而对完全训练好的 MoE 的实际转换则研究不足。实现这种适配将允许简单 token 在服务期间绕过不必要的专家,从而直接降低推理成本。本文提出了 Zero-Expert Self-Distillation Adaptation (ZEDA),这是一种将后训练静态 MoE 模型转换为高效动态模型的低成本框架。为了稳定这种架构转换,ZEDA 在每个 MoE 层中注入无参数的零输出专家,并通过两阶段自蒸馏适配增强后的模型,利用原始 MoE 作为冻结的教师并应用组级平衡损失。在 Qwen3-30B-A3B 和 GLM-4.7-Flash 上,跨越涵盖数学、代码和指令遵循的 11 个基准测试,ZEDA 在极小精度损失下消除了超过 50% 的专家 FLOPs。它在两个模型上分别比最强的动态 MoE 基线高出 6.1 和 4.0 个百分点,并实现了约 1.20 倍的端到端推理加速。
引用
@article{arxiv.2605.18643,
title = {Post-Trained MoE Can Skip Half Experts via Self-Distillation},
author = {Xingtai Lv and Li Sheng and Kaiyan Zhang and Yichen You and Siyan Gao and Xueheng Luo and Yuxin Zuo and Yuchen Fan and Junlin Yang and Ganqu Cui and Bingning Wang and Fan Yang and Youbang Sun and Ning Ding and Bowen Zhou},
journal= {arXiv preprint arXiv:2605.18643},
year = {2026}
}