中文

Mosaic 修剪:面向可泛化稀疏专家模型修剪的层次框架

机器学习 2025-11-26 v1 人工智能

摘要

稀疏混合专家 (SMoE) 架构正在推动大型语言模型 (LLM) 的规模化,因其在推理时仅激活总参数的一部分,具有卓越的性能。然而,其实际部署受到显著的静态内存开销的限制,因为所有专家都必须加载到内存中。现有后训练修剪方法虽然减小了模型规模,但往往基于单一通用语料库的修剪准则。这导致关键局限性:当修剪后的模型应用于其他领域时,性能会出现灾难性下降, necessitating 为每个新领域进行高成本的重新修剪。为解决这一泛化差距,我们提出 Mosaic 修剪 (MoP)。MoP 的核心思想是通过结构化的“聚类后选择”过程构建功能全面的专家集合。该过程利用捕捉不同任务领域中专家性能的相似性度量,对专家进行功能聚类,随后依据我们提出的激活波动性得分从每个聚类中选择最具代表性的专家。与针对单一语料库优化的 methods 不同,我们的 Mosaic 修剪确保修剪后的模型保留功能互补的专家集合——就像马赛克的瓷砖一样,整体构成原始模型能力的完整图景,从而能够处理多样化的下游任务。在 various MoE 模型上的大量实验表明,我们的方法优于先前工作。在通用任务上实现 7.24% 的提升,在数学推理和代码生成等专业任务上实现 8.92% 的提升。

关键词

引用

@article{arxiv.2511.19822,
  title  = {Mosaic Pruning: A Hierarchical Framework for Generalizable Pruning of Mixture-of-Experts Models},
  author = {Wentao Hu and Mingkuan Zhao and Shuangyong Song and Xiaoyan Zhu and Xin Lai and Jiayin Wang},
  journal= {arXiv preprint arXiv:2511.19822},
  year   = {2025}
}