中文

基于异构 expert 路由频率与信息密度的有效 MoE 型 LLM 压缩

机器学习 2026-02-13 v2

摘要

Mixture-of-Experts(MoE)型大语言模型(LLM)取得了卓越的性能,但存储多个 expert 网络所导致的巨大内存开销严重阻碍了其实际部署。基于奇异值分解(SVD)的压缩方法已成为一种有前景的 post-training 技巧;然而,大多数现有方法要么应用均匀秩分配,要么仅依赖静态权重属性,忽略了 MoE 模型中 expert 利用率存在的显著异构性——频繁路由模式和内在信息密度在不同 expert 之间存在显著差异。在本工作中,我们提出 RFID-MoE,一个通过挖掘异构 Routing Frequency 与 Information Density 来实现 MoE 压缩的有效框架。我们首先引入一种融合指标,将 expert 激活频率与有效秩结合,用于衡量 expert 的重要性,在固定预算下自适应分配更高的秩给关键 expert 组。此外,与传统做法不同,我们不丢弃压缩残差,而是通过一种参数高效稀疏投影机制对其进行重建,以最小化参数开销恢复丢失的信息。广泛的实验在代表性 MoE LLM(如 Qwen3、DeepSeekMoE)上进行,跨越多个压缩比率,证明 RFID-MoE 在诸多压缩比率上均优于像 MoBE 和 D2-MoE 等最新方法。值得注意的是,在 60% 压缩比率下,RFID-MoE 对 PTB 的 perplexity 仅为 16.92,较基线降低逾 8.0,且在 HellaSwag 上实现 zero-shot 准确率提升约 8%。

关键词

引用

@article{arxiv.2602.09316,
  title  = {Effective MoE-based LLM Compression by Exploiting Heterogeneous Inter-Group Experts Routing Frequency and Information Density},
  author = {Zhendong Mi and Yixiao Chen and Pu Zhao and Xiaodong Yu and Hao Wang and Yanzhi Wang and Shaoyi Huang},
  journal= {arXiv preprint arXiv:2602.09316},
  year   = {2026}
}