AIMER:无校准的无任务依赖的 MoE 剪枝
机器学习
2026-04-14 v2
摘要
Mixture-of-Experts (MoE) 语言模型通过不成比例增加参数容量来实现此目的,但部署仍需存储所有专家,从而使专家剪枝成为减少内存和 serving 开销的重要手段。现有无任务依赖的专家剪枝方法通常依赖校准:它们根据校准集上的路由或激活统计信息估计专家重要性,这使得剪枝结果对校准集的选择敏感,并增加了大量的预处理成本。我们引入 AIMER(Absolute mean over root mean square Importance for Expert Ranking,中文译为“绝对均值相对于平方根均值 importance 用于 expert ranking”,即“绝对均值/平方根均值专家重要性排序”),这是一个简单且无校准的准则,能够实现清晰的层内得分分离和显著的专家分层。 在 7B 到 30B 的 MoE 语言模型上进行 25% 和 50% 的剪枝比例测试,覆盖 16 个基准任务,AIMER 始终能够在仅用 0.22--1.27 秒对专家打分的情况下,持续提供具有竞争力或更强整体性能,无需依赖校准集。
引用
@article{arxiv.2603.18492,
title = {AIMER: Calibration-Free Task-Agnostic MoE Pruning},
author = {Zongfang Liu and Shengkun Tang and Yifan Shen and Huan Wang and Xin Yuan},
journal= {arXiv preprint arXiv:2603.18492},
year = {2026}
}