面向可部署大模型量化的速度探索
机器学习
2023-11-17 v1 计算与语言
摘要
大语言模型(LLM)时代迫切需求更快且成本更低的推理。先前针对 LLM 的模型压缩工作倾向于采取以软件为中心的方法,主要关注模拟量化性能。由于忽视部署可行性,这些方法在实际中通常无法使用。它们过去常常大幅压低量化比特范围以减少计算,而这可能不被主流硬件支持,或者涉及引入额外计算或内存访问开销的复杂算法。我们认为在量化算法构建中追求以硬件为中心的方法至关重要。为此,我们致力于在硬件感知之上构建压缩方法,消除不切实际的算法选择,同时最大化硬件加速的收益。我们的方法 OdysseyLLM 配备了一种称为 FastGEMM 的新型 W4A8 核实现以及组合量化策略方案。大量实验表明,我们的 W4A8 方法具有优越性,与 Hugging Face FP16 推理相比实际速度提升高达 \textbf{4},与 FP16 下的前沿推理引擎 TensorRT-LLM 相比为 \textbf{2.23},与 INT8 下的 TensorRT-LLM 相比为 \textbf{1.45},且未显著损害性能。
引用
@article{arxiv.2311.09550,
title = {A Speed Odyssey for Deployable Quantization of LLMs},
author = {Qingyuan Li and Ran Meng and Yiduo Li and Bo Zhang and Liang Li and Yifan Lu and Xiangxiang Chu and Yerui Sun and Yuchen Xie},
journal= {arXiv preprint arXiv:2311.09550},
year = {2023}
}