A2Q+: 改进累加器感知权重量化
机器学习
2024-01-22 v1 硬件体系结构
性能
摘要
量化技术通常通过限制权重和激活值的精度来降低神经网络的推理成本。最近的研究表明,降低累加器的精度也可以进一步提高硬件效率,但这存在数值溢出的风险,会引入算术误差从而降低模型精度。为了避免数值溢出同时保持精度,最近的研究提出了累加器感知量化(A2Q),这是一种量化感知训练方法,在训练期间约束模型权重,以便在推理时安全使用目标累加器位宽。尽管这显示出了前景,但我们证明 A2Q 依赖于一个过于严格的约束和一个次优的权重初始化策略,二者均引入了多余的量化误差。为了解决这些缺陷,我们引入了:(1)一个在不影响避免溢出的前提下放宽累加器约束的改进界限;(2)一种从预训练浮点检查点初始化量化权重的新策略。我们将这些贡献与权重归一化相结合,提出了 A2Q+。我们通过实验支持了我们的分析,实验表明 A2Q+ 显著改善了累加器位宽与模型精度之间的权衡,并刻画了由累加器约束引起的新权衡。
引用
@article{arxiv.2401.10432,
title = {A2Q+: Improving Accumulator-Aware Weight Quantization},
author = {Ian Colbert and Alessandro Pappalardo and Jakoba Petri-Koenig and Yaman Umuroglu},
journal= {arXiv preprint arXiv:2401.10432},
year = {2024}
}