后训练量化的可证明性:OPTQ 与 Qronos 的理论分析
机器学习
2026-04-13 v2 人工智能
信息论
数值分析
math.IT
数值分析
摘要
后训练量化(PTQ)已成为降低现代深度神经网络,包括大型语言模型(LLM)内存和计算成本的关键工具。在PTQ算法中,OPTQ框架——也称为 GPTQ——因其计算效率和强劲经验性能而成为领先方法。尽管其广泛采用,但OPTQ缺乏严格的定量理论保证。本文给出了OPTQ确定性和随机变体以及Qronos的最新相关SOTA PTQ算法的首个定量误差界。我们分析OPTQ的迭代程序如何诱导量化误差,并推导显式依赖校准数据和OPTQ使用的正则化参数的非渐近2-范数误差界。我们的分析为几个实际设计选择提供了理论依据,包括广泛使用的按范数降序排列特征的启发式方法,以及选择正则化参数的指导。对于随机变体,我们建立了更强的无穷范数误差界,这使得控制所需的量化字母表成为可能,特别适用于下游层和非线性函数。最后,我们将分析扩展到Qronos,为其确定性和随机变体提供新的理论界限,帮助解释其实际优势。
引用
@article{arxiv.2508.04853,
title = {Provable Post-Training Quantization: Theoretical Analysis of OPTQ and Qronos},
author = {Haoyu Zhang and Shihao Zhang and Ian Colbert and Rayan Saab},
journal= {arXiv preprint arXiv:2508.04853},
year = {2026}
}