PuzzleMoE:基于稀疏专家合并和位压推理的大规模混合专家模型高效压缩方法
机器学习
2025-11-10 v1 人工智能
摘要
混合专家(Mixture-of-Experts,MoE)模型通过仅激活每个输入的少数专家,展示了在高效扩缩放语言模型方面的强大潜力。然而,由于存储所有专家参数的高内存开销,特别是当专家数量增加时,其广泛部署仍受限。为此,先前的工作探索了专家丢弃和合并策略,但常常在高压缩比下出现性能下降。本文引入了 PuzzleMoE,这是一种无需训练的 MoE 压缩方法,通过两种关键创新实现高精度和高效推理:首先,PuzzleMoE 通过识别元素级权重的冗余性和专门化,进行稀疏专家合并。它使用双掩码捕获共享参数和专家特定参数。其次,为避免存储二进制掩码和符号的开销,PuzzleMoE 引入了位压编码方案,复用未使用的指数位,实现 GPU 上的高效 MoE 推理。大量实验表明,PuzzleMoE 可将 MoE 模型压缩最高达 50%,同时在 various 任务上保持准确率。具体而言,在 50% 压缩比下,PuzzleMoE 在 MMLU 上的性能比先前的 MoE 压缩方法提升最高可达 16.7%,实现最高达 1.28 倍的推理加速。
引用
@article{arxiv.2511.04805,
title = {PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference},
author = {Yushu Zhao and Zheng Wang and Minjia Zhang},
journal= {arXiv preprint arXiv:2511.04805},
year = {2025}
}