面向混合专家大语言模型的混合压缩器:增益更多
机器学习
2025-02-25 v2 计算与语言
摘要
混合专家大语言模型 (MoE-LLMs) 标志着语言模型的重要进步,然而,它们在实践中面临两个关键挑战:1) 专家参数导致可观的内存消耗和加载延迟;2) 当前激活的专家是冗余的,因为许多token可能只需要一个专家。受这些问题驱动,我们研究了 MoE-LLMs 并做出两个关键观察:a) 不同专家在激活重建误差、路由分数和激活频率上表现出不同行为,突显了它们不同的重要性;b) 并非所有token都同等重要——只有一小部分子集是关键。基于这些见解,我们提出了 MC,一种面向 MoE-LLMs 的免训练混合压缩器,它利用专家和token的重要性来实现极致压缩。首先,为了减轻存储和加载开销,我们引入了预加载混合精度量化,它将自适应位宽分配表述为一个线性规划问题,其中目标函数平衡反映每个专家重要性的多因素。此外,我们开发了在线动态剪枝,它在推理过程中识别重要token以保留,并动态选择其他token的激活专家,从而在保持性能的同时优化效率。我们的 MC 集成了静态量化和动态剪枝,以协同实现 MoE-LLMs 的极致压缩,同时减少精度损失,确保性能与效率之间的最优权衡。大量实验证实了我们方法的有效性。例如,在 2.54 位时,MC 压缩了 76.6% 的模型,平均精度损失仅为 3.8%。在动态推理过程中,我们进一步减少了 15% 的激活参数,性能下降小于 0.6%。
引用
@article{arxiv.2410.06270,
title = {Mixture Compressor for Mixture-of-Experts LLMs Gains More},
author = {Wei Huang and Yue Liao and Jianhui Liu and Ruifei He and Haoru Tan and Shiming Zhang and Hongsheng Li and Si Liu and Xiaojuan Qi},
journal= {arXiv preprint arXiv:2410.06270},
year = {2025}
}
备注
ICLR 2025