面向大型语言模型的累加器感知后训练量化
机器学习
2025-08-01 v2 人工智能
离散数学
摘要
当对权重和激活进行越来越窄的量化表示时,加法运算在乘加(MAC)单元中的成本开始支配乘法运算。最近的研究表明,通过低精度累加降低加法成本可提升推理平台的吞吐量、功耗和面积,尽管这会增加溢出风险。迄今为止,累加器感知量化研究仅关注量化感知训练(QAT)范式,即在量化进入的训练循环中进行微调或从头训练。随着模型和数据集规模的不断增大,QAT 技术变得愈加昂贵,这促使近期涌现出后训练量化(PTQ)研究。为填补这一差距,本文引入了 AXE,首个专为为 PTQ算法提供溢出避免保证的累加器感知量化框架。我们对 AXE 提出了理论动机,并通过实现两个现有算法:GPFQ 和 OPTQ 来展示其灵活性。我们设计 AXE 支持多阶段累加,首次为数据路径优化打开了大门。我们使用最新的语言生成模型进行评估;当对 Llama3 8B 进行 16 位多阶段累加数据路径量化时,AXE 可保持最高 98% 的 FP16 perplexity,将其超越于朴素位宽操作最高高出 15%。
引用
@article{arxiv.2409.17092,
title = {Accumulator-Aware Post-Training Quantization for Large Language Models},
author = {Ian Colbert and Giuseppe Franco and Fabian Grob and Jinjie Zhang and Rayan Saab},
journal= {arXiv preprint arXiv:2409.17092},
year = {2025}
}