幂次二 quantization-aware 训练 (PoT-QAT) 在大型语言模型中的应用
计算与语言
2026-01-06 v1 信号处理
摘要
在大型语言模型 (LLM) 中,参数数量在过去几年中呈指数级增长,例如从 GPT-2 的 15 亿参数增长到 GPT-3 的 1750 亿参数,甚至可能在更高版本中超过万亿参数。这对实际应用提出了重大挑战,尤其是对于边缘设备而言。不同于云计算,边缘设备的内存和处理能力非常有限,这迫使我们发展出新的思路来使此类应用可行。本文我们探究了使用限制为幂次二 (PoT) 的特殊量化压缩权重的方法,该方法仅存储指数,从而节省大量内存,更重要的是,通过用低成本的位移操作取代昂贵的乘法,显著降低了处理器开销。为克服由于该严格量化导致的性能损失,我们研究了量化感知训练 (QAT),通过额外的训练来提升性能。GPT-2 1.24 亿参数模型上的实验结果表明,经过额外训练后,量化 PoT 模型性能大幅提升,困惑度提升 66%,BERT-Score 相对于基线 GPT-2 的损失仅为 1%。估计可实现 87.5% 的内存节省,而在 PoT 量化相对于全精度时,推理速度预计可提高 3-10 倍。
引用
@article{arxiv.2601.02298,
title = {Power-of-Two Quantization-Aware-Training (PoT-QAT) in Large Language Models (LLMs)},
author = {Mahmoud Elgenedy},
journal= {arXiv preprint arXiv:2601.02298},
year = {2026}
}