QRazor:通过显著数据削减实现可靠无痛 4 位 LLM 量化
机器学习
2025-02-06 v2
摘要
大规模语言模型(LLM)在语言处理任务中表现出色,但因高内存和计算需求面临部署挑战。虽然低位量化(如 4 位技术)提供了潜在解决方案,但这些方法常常出现显著的精度损失或需要相当大的实现工作量,如重新排序、旋转等。为此,我们提出了 QRazor—a 一种简单而有效的量化方案,使其能够对基于 Transformer 的 LLM 中的权重、激活值和 KV 缓存进行 4 位量化。QRazor 在两个阶段运行:首先,以 8 或 16 位整数为基准并采用绝对最大值缩放以保持接近全精度模型的准确度,其次,通过我们的显著数据削减(SDR)技术将量化数据压缩到 4 位,该技术仅保留最显著的四个位。无需任何额外的微调或训练要求,QRazor 在准确度上可与或优于当前 4 位量化方法的最佳水平,在 LLaMA2-7B 模型上的零样本推理任务准确度中,分别超过 Smoothquant 和 QLLM 超过 12 分,超过 Quarot(RTN) 超过 2.9 分。此外,我们引入了一个针对 QRazor 优化的整数运算单元,允许对 SDR 数据直接进行低精度运算而无需解压。
引用
@article{arxiv.2501.13331,
title = {Qrazor: Reliable and Effortless 4-bit LLM Quantization by Significant Data Razoring},
author = {Dongyoung Lee and Seungkyu Choi and Ik Joon Chang},
journal= {arXiv preprint arXiv:2501.13331},
year = {2025}
}
备注
16 pages