中文

ILMPQ:一种面向 FPGA 的层内多精度深度神经网络量化框架

机器学习 2021-11-02 v1

摘要

本工作以常用的 FPGA(现场可编程门阵列)器件作为 DNN 边缘计算的硬件平台。我们聚焦于 DNN 量化作为主要模型压缩技术。本工作的新颖性在于:我们使用的量化方法支持沿层内维度的多精度,而现有量化方法沿层间维度应用多精度量化。层内多精度方法可使不同层的硬件配置统一,从而减少计算开销,同时像层间方法一样保持模型精度。我们提出的 ILMPQ DNN 量化框架在 ImageNet 数据集的 ResNet-18 上达到 70.73 的 Top1 精度。我们还在两款 FPGA 器件(即 Xilinx XC7Z020 与 XC7Z045)上验证了所提 MSP 框架。与定点量化方法相比,我们在 ImageNet 上实现了端到端推理时间 3.65 倍加速。

关键词

引用

@article{arxiv.2111.00155,
  title  = {ILMPQ : An Intra-Layer Multi-Precision Deep Neural Network Quantization framework for FPGA},
  author = {Sung-En Chang and Yanyu Li and Mengshu Sun and Yanzhi Wang and Xue Lin},
  journal= {arXiv preprint arXiv:2111.00155},
  year   = {2021}
}

备注

Accepted by CogArch 2021: 5th Workshop on Cognitive Architectures