TurboBoA:无需反向传播的快速且精确注意力感知量化
机器学习
2026-02-06 v1
摘要
大语言模型(LLM)的快速增长加剧了后训练量化(PTQ)以降低内存和计算成本的重要性。在 PTQ 方法中,GPTQ 因其高效性受到广泛关注,能够在数小时内完成千亿参数规模的模型量化。然而,GPTQ 假设层间独立性,在低比特场景下导致严重的准确率下降。最近,BoA 通过纳入注意力模块中的层间依赖项予以改进,但其依赖于所有输出通道的顺序量化,显著降低了效率。本文提出 TurboBoA,一种新的无反向传播 PTQ 算法,保留 BoA 的准确率优势,同时显著加快进程。TurboBoA 引入三个关键创新:① 多输出通道联合量化并采用闭式误差补偿规则,减少顺序瓶颈,加速速度提升三倍以上;② 针对来自前序量化层的误差传播引入校正机制;③ 采用坐标下降进行自适应网格计算,以保持迭代更新期间的对齐。大量实验表明,TurboBoA 在 BoA 基础上显著加速,同时持续提升准确率。结合异常值抑制技术后,达到权重唯一量化和权重-激活量化的统一最先进水平。代码将在 https://github.com/SamsungLabs/TurboBoA 发布
引用
@article{arxiv.2602.04929,
title = {TurboBoA: Faster and Exact Attention-aware Quantization without Backpropagation},
author = {Junhan Kim and Yeo Jeong Park and Seungwoo Son and Chungman Lee and Ho-young Kim and Joonyoung Kim and Yongkweon Jeon},
journal= {arXiv preprint arXiv:2602.04929},
year = {2026}
}
备注
ICLR 2026