中文

用于精确硬件仿真的量化深度神经网络库开发

机器学习 2021-06-17 v1 人工智能

摘要

在 AI 芯片等边缘设备上运行深度神经网络(DNNs)时,量化被用于加速执行并节省功耗。为研究量化的影响,我们需要对以 32 位浮点精度表示的 DNN 权重按某位宽进行量化,再量化回 32 位浮点精度后执行推理。这是因为 DNN 库只能处理浮点数。然而,此类仿真的精度并不准确。我们需要精确精度以检测 MAC 运算中的溢出或验证边缘设备上的运算。我们开发了 PyParch,一个以与硬件完全相同的行为执行量化 DNNs(QNNs)的 DNN 库。本文描述了 PyParch 的新方案与实现。评估结果表明,可对 YOLOv5 等大型复杂 DNNs 估计任意位宽 QNNs 的精度,并检测溢出。我们评估了仿真时间的开销,发现相较于常规 DNN 执行时间,QNN 慢 5.6 倍,带溢出检测的 QNN 慢 42 倍。

关键词

引用

@article{arxiv.2106.08892,
  title  = {Development of Quantized DNN Library for Exact Hardware Emulation},
  author = {Masato Kiyama and Motoki Amagasaki and Masahiro Iida},
  journal= {arXiv preprint arXiv:2106.08892},
  year   = {2021}
}