中文

Mixture-of-Experts 后训练量化研究:QuantMoE-Bench

机器学习 2025-02-26 v2 人工智能 计算与语言

摘要

Mixture-of-Experts(MoE)是一种有前景的扩大大型语言模型学习容量的方法。它通过稀疏激活在推理期间几乎保持恒定的 FLOPs 数量,从而增加参数数量。然而,它仍因大规模参数大小而受到显著的内存开销影响,这迫使需要模型压缩技术。后训练量化提供了一种强大的模型压缩方法。现有方法采用整个 MoE 模型的固定量化精度,这种僵化设置可能导致次优性能,因而未能考虑稀疏结构的内在特征。例如,MoE 的稀疏路由机制导致不同的激活模式,其中共享专家被所有 token 访问,而基于 token 的条件专家被选择性激活。这种激活差异表明需要不同的量化要求,持续激活的共享专家可能需要更高的精度以维持模型质量。在本文中,我们研究了 MoE 量化的细粒度精度设置。我们探索了从粗粒度(例如 MoE 层)到细粒度(例如线性层)的 MoE 结构感知量化启发式方法。我们的调查揭示了不同 MoE 结构有效量化所需的位数的关键原则。通过在两个代表性 MoE 模型和包括常识推理和自然语言理解等六个任务上的大规模基准测试支持了这些结论。我们进一步表明,采用细粒度混合精度量化的 MoE 在平均性能上实现了相对于基线 64.30% 的最新水平 65.35%。基于我们的发现,我们引入了新的数据驱动技术,用于优化 MoE 量化中的比特分配,包括异常值感知线性层评分器和 MoE 块重要性预测器。

关键词

引用

@article{arxiv.2406.08155,
  title  = {QuantMoE-Bench: Examining Post-Training Quantization for Mixture-of-Experts},
  author = {Pingzhi Li and Xiaolong Jin and Zhen Tan and Yu Cheng and Tianlong Chen},
  journal= {arXiv preprint arXiv:2406.08155},
  year   = {2025}
}

备注

Our code for reproducing all our experiments is provided at https://github.com/UNITES-Lab/moe-quantization