使 LLM 激活值对量化友好
机器学习
2025-06-04 v1 人工智能
计算与语言
摘要
量化通过压缩参数加速数据传输并借助整数算术实现更快的运算,从而有效降低大型语言模型(LLM)的推理服务成本。然而,启用整数算术需要同时对权重和激活值进行量化,由于 LLM 中存在显著离群值,会增加量化误差,这带来了挑战。在本工作中,我们研究了这些离群值,重点关注其对逐层量化误差的影响,随后探讨了平滑与旋转变换如何改变观测值。我们的主要贡献包括:引入一种基于通道幅值来度量和可视化量化难度的新指标,以及提出一种在旋转前应用逐通道缩放的混合方法,并通过数学公式化论证了其优势。
引用
@article{arxiv.2506.01967,
title = {Turning LLM Activations Quantization-Friendly},
author = {Patrik Czakó and Gábor Kertész and Sándor Szénási},
journal= {arXiv preprint arXiv:2506.01967},
year = {2025}
}
备注
6 pages, 5 figures. Accepted to SACI 2025 conference proceedings