QMoE:万亿参数模型的实用亚 1 比特压缩
机器学习
2023-10-26 v1
摘要
混合专家 (Mixture-of-Experts, MoE) 架构通过稀疏路由为大型语言模型 (LLM) 的高推理成本提供了通用解决方案,带来了更快且更精确的模型,代价是参数量巨大。例如,SwitchTransformer-c2048 模型拥有 1.6 万亿参数,需要 3.2TB 的加速器内存才能高效运行,这使得实际部署具有挑战性且成本高昂。在本文中,我们提出了一种解决该内存问题的方案,形式为一种称为 QMoE 的新压缩与执行框架。具体而言,QMoE 由一个可扩展算法组成,该算法将万亿参数 MoE 精确压缩至每参数低于 1 比特,采用与定制 GPU 解码内核协同设计的自定义格式,以促进高效的端到端压缩推理,相对于未压缩执行仅有微小的运行时开销。具体地,QMoE 可以在单个 GPU 上不到一天的时间内,将 1.6 万亿参数的 SwitchTransformer-c2048 模型压缩至不到 160GB(20 倍压缩,每参数 0.8 比特),且仅有轻微精度损失。这首次使得在实惠的商用硬件上执行万亿参数模型成为可能,例如配备 4 块 NVIDIA A6000 或 8 块 NVIDIA 3090 GPU 的单一服务器,相对于理想未压缩推理的运行时开销低于 5%。源代码和压缩模型可在 github.com/IST-DASLab/qmoe 获取。
引用
@article{arxiv.2310.16795,
title = {QMoE: Practical Sub-1-Bit Compression of Trillion-Parameter Models},
author = {Elias Frantar and Dan Alistarh},
journal= {arXiv preprint arXiv:2310.16795},
year = {2023}
}