BoA:无需反向传播的注意力感知后训练量化
机器学习
2025-06-09 v3 人工智能
摘要
后训练量化(PTQ)是将大型语言模型(LLM)部署到资源受限设备上的热门解决方案。早期针对小型网络(如ResNet)开发的方法依赖于梯度-based优化,对拥有数十亿参数的超大规模LLM而言不够实用。虽然近期提出的无反向传播或基于转换的方法缓解了这一问题,但它们要么忽视层间相互作用,要么采用朴素的最近取整-based的量化权重分配以节省权重优化的高计算成本。本文引入了一种新颖的无反向传播PTQ算法,通过考虑层间依赖性来优化量化权重。我们的关键创新在于开发注意力感知的Hessian矩阵,以捕获注意力模块内的层间相互作用。大量实验表明,我们的方法不仅超越现有权重量化方法,还与常规方法良性协同,有效抑制激活异常值,实现了最新的权重-激活量化性能。代码将在https://github.com/SamsungLabs/BoA发布。
关键词
引用
@article{arxiv.2406.13474,
title = {BoA: Attention-aware Post-training Quantization without Backpropagation},
author = {Junhan Kim and Ho-young Kim and Eulrang Cho and Chungman Lee and Joonyoung Kim and Yongkweon Jeon},
journal= {arXiv preprint arXiv:2406.13474},
year = {2025}
}
备注
ICML 2025