OAC:面向准后训练量化的输出自适应校准
机器学习
2025-05-07 v2 计算与语言
摘要
大型语言模型(LLM)的部署因其规模的快速扩大而面临巨大的计算成本。压缩 LLM 可减少其推理所需的内存、延迟和能耗。已developed 后训练量化(PTQ)技术以在不进行昂贵再训练的情况下压缩 LLM。大多数 PTQ 方法基于层级欧几里得损失函数形式化量化误差,忽略模型输出。然后,每个层级基于其层级 Hessian 来校准权重,以最小化量化误差。Hessian 也用于检测最具意义的量化权重。此类 PTQ 方法在低精度量化时容易出现精度下降。我们提出的输出自适应校准(OAC)将模型输出纳入校准过程中。我们基于输出交叉熵损失的扭曲来形式化量化误差。OAC 在合理假设下逼近每个层级的输出自适应 Hessian,以减少计算复杂度。输出自适应 Hessian 用于更新权重矩阵并检测最具意义的权重,以维持模型输出。我们的方法在各种最先进的基准(如 SpQR 和 BiLLM)方面表现优异,尤其是在极端低精度(2 位和二进制)量化时。
关键词
引用
@article{arxiv.2405.15025,
title = {OAC: Output-adaptive Calibration for Accurate Post-training Quantization},
author = {Ali Edalati and Alireza Ghaffari and Mahsa Ghazvini Nejad and Lu Hou and Boxing Chen and Masoud Asgharian and Vahid Partovi Nia},
journal= {arXiv preprint arXiv:2405.15025},
year = {2025}
}
备注
22 pages, 4 figures