Agile-Quant:面向边缘端 LLM 加速推理的激活引导量化
机器学习
2025-04-22 v2 人工智能
计算与语言
摘要
大型语言模型 (LLM) 因其在复杂语言建模任务中的出色表现而脱颖而出。然而,其对计算和内存的高需求为在边缘设备上的广泛部署构成了障碍。随后引入了量化以提升 LLM 的设备端效率。近期工作表明,8 位或更低权重的量化是可行的,且对端到端任务性能的影响极小,但激活值仍未被量化。另一方面,主流商用边缘设备仍难以有效执行这些低于 8 位的量化网络。在本文中,我们提出了 Agile-Quant,一个针对流行大型语言模型 (LLM) 的激活引导量化框架,并在多种边缘设备上实现了端到端加速器以实现更快的推理。考虑到硬件性能分析和激活值分析,我们首先引入一种基础激活量化策略,以平衡任务性能与实际推理速度之间的折中。然后,我们利用激活感知的 token 剪枝技术来减少异常值及其对注意力机制的不利影响。最后,我们利用基于 SIMD 的 4 位乘法器和高效的 TRIP 矩阵乘法,在边缘端实现 LLM 加速器。我们将我们的框架应用于不同规模的 LLM,包括 LLaMA、OPT 和 BLOOM,激活值采用 4 位或 8 位量化,权重采用 4 位量化。实验表明,Agile-Quant 实现了模型权重和激活值的同时量化,同时保持了与现有仅权重量化方法相当的任务性能。此外,在 8 位和 4 位场景下,与 FP16 对应版本相比,Agile-Quant 在多种边缘设备上实现了高达 2.55 倍的设备端加速,标志着该领域的开创性进展。代码:https://github.com/shawnricecake/agile-quant
引用
@article{arxiv.2312.05693,
title = {Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge},
author = {Xuan Shen and Peiyan Dong and Lei Lu and Zhenglun Kong and Zhengang Li and Ming Lin and Chao Wu and Yanzhi Wang},
journal= {arXiv preprint arXiv:2312.05693},
year = {2025}
}
备注
Accepted by AAAI 2024