中文

面向边缘的大规模 MoE 部署的协作压缩

人工智能 2025-10-01 v1 机器学习

摘要

混合专家(MoE)架构是扩大大型语言模型(LLM)容量的重要方法,能够在保持计算成本低的同时提升模型容量。然而,超大型 MoE 模型仍需数百亿参数,导致存储/存储需求巨大,难以在资源受限的边缘平台部署。剪枝或量化alone 难以解决此问题,因压缩比率极端激进且显著降低准确率和输出质量。为促进超大型 MoE 在边缘平台的部署,我们提出一种协作压缩框架,结合专家剪枝、混合精度量化和激活优化。该框架可将超大型 DeepSeek-V3 模型的存储占用从 1.3TB 降至 103GB,同时保持高输出质量,准确率优于传统统一低位量化方法。据我们了解,本文是首个在总内存限制为 128GB 的平台上部署来自超大型 DeepSeek-V3 压缩模型的研究。我们的全面实验在多种基准测试和各种内存约束下表明,该方法在更小模型规模和更高准确率方面优于统一低位量化方法。

关键词

引用

@article{arxiv.2509.25689,
  title  = {Collaborative Compression for Large-Scale MoE Deployment on Edge},
  author = {Yixiao Chen and Yanyue Xie and Ruining Yang and Wei Jiang and Wei Wang and Yong He and Yue Chen and Pu Zhao and Yanzhi Wang},
  journal= {arXiv preprint arXiv:2509.25689},
  year   = {2025}
}