深度神经网络激活的 DQA:一种高效的深度量化方法
机器学习
2024-12-16 v1 计算机视觉与模式识别
机器学习
摘要
深度神经网络(DNN)激活的量化是一种常用的技术,用于在 DNN 推理期间减少计算和内存需求, particularly beneficial on resource-constrained devices. 为实现高精度,现有用于量化激活的方法依赖于复杂的数学计算或进行 extensive 搜索以寻找最佳超参数。然而,这些高成本的操作在计算能力有限、内存容量受限且能源预算紧张的设备上是不可行的。此外,许多现有方法不关注亚 6 位(或深度)量化。为填补这一空白,本文提出了 DQA(Deep Quantization of DNN Activations),一种新方法,专注于激活的亚 6 位量化,利用简单的移位操作和赫夫曼编码实现高效性和高精度。我们在三个不同的 DNN 模型上评估了 DQA,分别进行图像分类和图像分割任务,分别使用两个不同的数据集。DQA 在亚 6 位量化方面显示出显著更好的准确率(最高可达 29.28%),相较于直接量化方法和最新无噪声量化(NoisyQuant)方法。
引用
@article{arxiv.2412.09687,
title = {DQA: An Efficient Method for Deep Quantization of Deep Neural Network Activations},
author = {Wenhao Hu and Paul Henderson and José Cano},
journal= {arXiv preprint arXiv:2412.09687},
year = {2024}
}
备注
Accepted to Second Workshop on Machine Learning with New Compute Paradigms at NeurIPS 2024 (MLNCP 2024)