中文

是否足够无 retraining?路由校准是高效MoE压缩的必要条件

机器学习 2026-03-04 v1 人工智能

摘要

混合专家(MoE)模型通过高效扩大容量实现规模化,但巨大的参数存储造成部署时的内存瓶颈。我们将无 retraining 的 MoE 压缩组织为三个范式——专家剪枝、专家编辑和专家合并,并指出持续的压缩后退步主要源于被忽视的一个因素:当专家被更改而路由被保留不动时出现的路由-专家不匹配。我们认为有效的无 retraining 压缩应避免更新专家参数,同时允许轻量级路由校准。为此,我们提出了路由知识蒸馏(Router KD),通过在无标签校准数据上蒸馏原始模型的下一个 token 分布来仅更新极少数参数(路由)。在三个代表性方法的实验中均表现出一致的性能恢复,尤其在细粒度MoE(许许多多小专家)中比在粗粒度MoE(较少专家)中获得显著更大的收益,due to 其更复杂的路由决策边界。

关键词

引用

@article{arxiv.2603.02217,
  title  = {Is Retraining-Free Enough? The Necessity of Router Calibration for Efficient MoE Compression},
  author = {Sieun Hyeon and Jaeyoung Do},
  journal= {arXiv preprint arXiv:2603.02217},
  year   = {2026}
}