中文

DNA-TEQ:一种用于 DNN 推理的张量自适应指数量化方法

机器学习 2023-11-23 v2 硬件体系结构

摘要

量化常用于深度神经网络(DNN)中,通过降低激活值与权重(即张量)的算术精度来减少存储与计算复杂度。高效的硬件架构采用线性量化,以将近期 DNN 部署到嵌入式系统与移动设备上。然而,线性均匀量化通常无法在模型精度方面不牺牲高性能的前提下将数值精度降至 8 位以下。性能损失源于张量并不服从均匀分布。本文中,我们表明有相当数量的张量符合指数分布。进而,我们提出 DNA-TEQ,以自适应方案对 DNN 张量进行指数量化,在数值精度与精度损失之间取得最佳权衡。实验结果表明,与先前方案相比,DNA-TEQ 提供了更低的量化位宽,相对于线性 INT8 基线实现了平均 40% 的压缩比,且精度损失可忽略,并无需对 DNN 重新训练。此外,DNA-TEQ 开创了在指数域执行点积运算的先河,对于一组广泛使用的 DNN,平均节省 66% 的能耗。

关键词

引用

@article{arxiv.2306.16430,
  title  = {DNA-TEQ: An Adaptive Exponential Quantization of Tensors for DNN Inference},
  author = {Bahareh Khabbazan and Marc Riera and Antonio González},
  journal= {arXiv preprint arXiv:2306.16430},
  year   = {2023}
}

备注

10 pages, 8 figures, 5 tables