面向大语言模型后训练量化的自适应层级变换
机器学习
2025-11-25 v1
摘要
大语言模型在部署过程中需要巨大的计算资源,使得量化成为实际应用的必要手段。然而,有效量化的主要障碍在于激活和权重中的系统性异常值,这会在低比特设置下导致显著的LLM性能下降。虽然现有的基于变换的方法(如仿射变换和旋转变换)成功缓解了异常值问题,但这些方法采用统一的变换设置,即在所有层上使用相同的变换类型,忽略了LLM内部各层分布特性的异质性。本文提出了一个自适应变换选择框架,系统性地在每一层上确定最优变换。为此,我们首先将变换选择表述为可微分的优化问题,以实现每个层的最佳变换类型。然而,为每个模型搜索最佳的层级变换计算开销巨大。为此,我们建立了权重分布厚度与准确变换类型之间的联系。具体而言,我们提出了一种使用稳健z-score归一化的异常值引导层选择方法,该方法在显著降低开销的同时,实现了与可微分搜索相当的性能。广泛实验表明,我们的自适应方法在广泛使用的固定变换设置下持续优于后者。例如,在LLaMA-3-8B模型上采用激进的W3A3K2V2量化设置时,我们的方法相较于当前最佳方法FlatQuant实现了最高可达4.58个困惑度点提升和2.11%的平均六任务零样本准确率提升,证明了针对不同层进行异构变换选择对实现最优LLM量化的必要性。
引用
@article{arxiv.2511.17809,
title = {Adaptive Layer-Wise Transformations for Post-Training Quantization of Large Language Models},
author = {Cuong Pham and Hoang Anh Dung and Cuong C. Nguyen and Trung Le and Gustavo Carneiro and Jianfei Cai and Thanh-Toan Do},
journal= {arXiv preprint arXiv:2511.17809},
year = {2025}
}