基于层次聚类的稀疏 MoE 重训练自由合并
机器学习
2025-10-28 v4
摘要
稀疏混合专家 (SMoE) 模型通过高效参数利用实现了大型语言模型 (LLM) 开发的重大进展。这些模型在降低推理成本的同时实现了显著的性能提升。然而,SMoE 模型的部署受限于资源受限环境中专家组件的大量内存需求。为解决这些限制,本文引入基于层次聚类的稀疏混合专家 (HC-SMoE),这是一种无需重训练的参数压缩的任务无关专家合并框架。HC-SMoE 引入一种基于专家输出的层次聚类方法,以确保合并后鲁棒性独立于路由决策。提出的基于输出的聚类方法能够有效捕获大规模架构中专家之间的功能关系。我们提供了理论分析并对多个零样本语言任务进行全面评估,以证明 HC-SMoE 对包括 Qwen 和 Mixtral 在内的前沿模型的有效性。实验结果验证了 HC-SMoE 在实际部署中的卓越性能和实用性。
引用
@article{arxiv.2410.08589,
title = {Retraining-Free Merging of Sparse MoE via Hierarchical Clustering},
author = {I-Chun Chen and Hsu-Shen Liu and Wei-Fang Sun and Chen-Hao Chao and Yen-Chang Hsu and Chun-Yi Lee},
journal= {arXiv preprint arXiv:2410.08589},
year = {2025}
}
备注
Code: https://github.com/wazenmai/HC-SMoE. Accepted by ICML 2025