揭示混合专家大语言模型中的超级专家
计算与语言
2026-02-12 v3
摘要
在本研究中,我们首次报告发现并系统调查了一类独特的专家子集,它们在 MoE LLM 的前向推理中起着关键作用。这些专家在开源 MoE LLM 中普遍存在,尽管其数量极为有限,但剪枝它们会导致模型性能的大幅下降(例如,在 6,144 个专家中仅剪枝 3 个就会导致 Qwen3-30B-A3B 生成重复且无信息量的输出)。我们将这些专家称为超级专家。我们的全面分析提供了对 SE 的逐步深入的认识:(i) SE 的特征是 down_proj 输出中罕见但极端的激活异常值,这些异常值在解码器层之间的隐藏状态中引起大规模激活。此外,SE 的分布是模型特定的、与数据无关的,且不受训练后过程的影响。(ii) 通过剪枝 SE,我们评估了它们在各种任务中的重要性,揭示了它们对模型整体性能的巨大影响,尤其是在数学推理方面。(iii) 我们进一步研究了为什么压缩 SE 会产生如此显著的影响。我们表明,在 MoE LLM 中,SE 充当 Transformer 中系统性异常值机制的主要来源,压缩它们会深刻破坏这一过程,最终导致注意力汇的崩溃。这些发现推进了对 MoE LLM 内部动态的理解,填补了当前知识中的一个重要空白。代码提供于 https://github.com/ZunhaiSu/Super-Experts-Profilling。
引用
@article{arxiv.2507.23279,
title = {Unveiling Super Experts in Mixture-of-Experts Large Language Models},
author = {Zunhai Su and Qingyuan Li and Hao Zhang and Weihao Ye and Qibo Xue and YuLei Qian and Yuchen Xie and Ngai Wong and Kehong Yuan},
journal= {arXiv preprint arXiv:2507.23279},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026