A2Q:具有溢出避免保证的累加器感知量化
机器学习
2023-08-28 v1 硬件体系结构
计算机视觉与模式识别
摘要
我们提出累加器感知量化(A2Q),一种新颖的权重量化方法,旨在训练量化神经网络(QNNs)以在使用低精度累加器进行推理时避免溢出。A2Q 引入一种受权重归一化启发的独特公式,根据我们推导的累加器位宽界限约束模型权重的 L1 范数。因此,在为低精度累加训练 QNNs 时,A2Q 也固有地促进非结构化权重稀疏性以保证溢出避免。我们将该方法应用于基于深度学习的计算机视觉任务,表明 A2Q 可为低精度累加器训练 QNNs,同时保持与浮点基线竞争的模型精度。在评估中,我们考虑 A2Q 对通用平台与可编程硬件的影响。然而,我们主要面向 FPGA 上的模型部署,因其可被编程以充分利用自定义累加器位宽。我们的实验表明累加器位宽显著影响基于 FPGA 的加速器的资源效率。在我们的基准测试上平均而言,A2Q 相较 32 位累加器对应方案提供高达 2.3 倍的资源利用率降低,且达到浮点模型精度的 99.2%。
引用
@article{arxiv.2308.13504,
title = {A2Q: Accumulator-Aware Quantization with Guaranteed Overflow Avoidance},
author = {Ian Colbert and Alessandro Pappalardo and Jakoba Petri-Koenig},
journal= {arXiv preprint arXiv:2308.13504},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2301.13376