MoNE:用轻量级 novice 替换冗余 expert 以实现 MoE 的结构化剪枝
机器学习
2026-02-24 v2
摘要
混合专家(MoE)通过仅激活每个输入 token 的一部分专家来实现大型语言模型的高效扩展。然而,部署基于 MoE 的模型由于需要保留所有专家而导致显著的内存开销。虽然结构化剪枝有望降低内存成本,但现有方法在三个维度上常表现出次优性能和不稳定的性能下降:模型架构、校准数据来源以及校准样本大小。本文提出了 Mixture-of-Novices-and-Experts(MoNE),一种新的专家剪枝方法,通过用轻量级 novice 替换冗余专家来实现有效且稳健的模型压缩。MoNE 基于两个指标评估专家的冗余性:访问频率和输出方差。具有低使用频率和稳定输出的专家将被剪枝并替换为轻量级 novice——即其原始输出的无偏估计——以最小化性能下降。广泛的实验表明,MoNE 在三个维度上均优于基线方法,性能 degradation 最小,证明了其有效性和稳健性。值得注意的是,在 25% 剪枝比例下,MoNE 对九个下游任务的平均 zero shot accuracy 最高可提高 2.72,仅有 0.14 的性能下降用于 Qwen2-57B-A14B。代码可在 https://github.com/zxgx/mode-pd 获取。
关键词
引用
@article{arxiv.2507.00390,
title = {MoNE: Replacing Redundant Experts with Lightweight Novices for Structured Pruning of MoE},
author = {Geng Zhang and Yuxuan Han and Yuxuan Lou and Yiqi Zhang and Wangbo Zhao and Yang You},
journal= {arXiv preprint arXiv:2507.00390},
year = {2026}
}
备注
Accepted by ICLR 2026