PoTPTQ:面向 LLM 的两步 2 的幂次方训练后量化
计算与语言
2025-07-17 v1 人工智能
机器学习
摘要
大型语言模型(LLMs)在各种自然语言处理(NLP)任务中展现出了卓越的性能。然而,由于需要大量的计算资源,其部署面临挑战。2 的幂次方(PoT)量化是对抗这一困难的一般工具。尽管先前关于 PoT 量化的工作可以使用定点加法在 CPU 上高效反量化,但在 GPU 上却表现出较低的有效性。原因在于反量化所需的符号位纠缠与顺序位操作。我们提出了一种用于 LLM 权重的新型 PoT 量化框架,该框架 极低精度数字格式下的准确率优于现有 SOTA,并且 通过更高效的反量化实现更快的推理。为保持量化模型的准确率,我们引入了一种两步训练后算法: 使用稳健的起点初始化量化缩放因子; 使用最小校准集微调这些缩放因子。我们的 PoT 训练后算法的性能超越了当前整数量化领域的 SOTA,特别是在 2 位和 3 位格式等低精度下。我们的 PoT 量化加速了浮点推理所需的反量化步骤,与均匀整数反量化相比,在 NVIDIA V100 上实现了 的加速,在 NVIDIA RTX 4090 上实现了 的加速。
引用
@article{arxiv.2507.11959,
title = {PoTPTQ: A Two-step Power-of-Two Post-training for LLMs},
author = {Xinyu Wang and Vahid Partovi Nia and Peng Lu and Jerry Huang and Xiao-Wen Chang and Boxing Chen and Yufei Cui},
journal= {arXiv preprint arXiv:2507.11959},
year = {2025}
}
备注
Accepted at ECAI 2025 (European Conference on Artificial Intelligence)