大语言模型的双向量化误差抑制方法 BiSup
计算与语言
2024-05-27 v1 人工智能
机器学习
摘要
随着大型语言模型 (LLM) 的规模和上下文长度的增长,权重-激活量化已成为高效部署 LLM 的关键技术。相较于权重-only 量化,权重-激活量化更具挑战性,因为激活值存在异常值。现有方法通过探索混合精度量化和异常值抑制取得了显著进展,但这些方法主要聚焦于优化单个矩阵乘法的结果,忽略了 LLM 中量化误差的双向传播。具体而言,误差在同一 token 经过各层时向下累积,由于自注意力机制,还会在不同 token 之间水平扩散。为解决此问题,我们提出了双向量化误差抑制方法 BiSup。通过构建适当的可优化参数空间,BiSup 使用少量数据进行量化感知参数高效微调,以抑制误差的垂直累积。此外,BiSup 采用提示词混合精度量化策略,保留系统提示词 key-value cache 的高精度,以缓解误差的水平扩散。对 Llama 和 Qwen 系列模型进行大量实验表明,BiSup 在两个最先进方法之上实现了性能提升(在 W3A3-g128 配置下,Atom 的平均 WikiText2 困惑度从 13.26 下降至 9.41,QuaRot 的困惑度从 14.33 下降至 7.85),进一步促进了低比特权重-激活量化的实际应用。
引用
@article{arxiv.2405.15346,
title = {BiSup: Bidirectional Quantization Error Suppression for Large Language Models},
author = {Minghui Zou and Ronghui Guo and Sai Zhang and Xiaowang Zhang and Zhiyong Feng},
journal= {arXiv preprint arXiv:2405.15346},
year = {2024}
}