中文

OstQuant:基于正交变换与缩放变换细化大语言模型量化以实现更佳分布拟合

机器学习 2025-01-27 v1 人工智能

摘要

后训练量化(PTQ)已成为压缩和加速大语言模型(LLM)的广泛采用的技术。大语言模型量化的主要挑战在于,数据分布不均且呈重尾分布会扩大量化范围,从而降低大多数值的位精度。最近的一些方法试图通过采用线性变换来消除异常值并平衡信道间差异;然而,这些方法仍具有启发性,且常常忽略优化整个量化空间上的数据分布。本文引入了量化空间利用率(QSUR)这一新指标,通过衡量数据在量化空间内的空间利用率,有效评估变换后数据的可量化性。我们对QSUR进行数学推导,检验 various 变换的作用及其局限性,引导我们开发正交变换和缩放变换基于量化的量化(OSTQuant)。OSQuant采用可学习的等效变换,包含正交变换和缩放变换,优化整个量化空间上权重和激活的分布。此外,我们提出KL-Top损失函数,旨在在PTQ受限校准数据带来的噪声缓解优化的同时,保留更丰富的语义信息。OSTQuant在各种LLM和基准测试上均优于现有工作。在仅使用4位(W4-only)设置下,保留了99.5%的浮点精度。在更具挑战性的W4A4KV4配置下,OSTQuant将LLaMA-3-8B模型上与最先进方法相比的性能差距缩小了32%。

关键词

引用

@article{arxiv.2501.13987,
  title  = {OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting},
  author = {Xing Hu and Yuan Cheng and Dawei Yang and Zukang Xu and Zhihang Yuan and Jiangyong Yu and Chen Xu and Zhe Jiang and Sifan Zhou},
  journal= {arXiv preprint arXiv:2501.13987},
  year   = {2025}
}

备注

10 Pages