中文

技术报告:用于部署模型的 NEMO DNN 量化

机器学习 2020-04-14 v1 人工智能 神经与进化计算 机器学习

摘要

本技术报告旨在为深度神经网络(DNN)逐层量化定义一个形式化框架,特别关注与最终部署相关的问题。它同时作为 NEMO(NEural Minimization for pytOrch)框架的文档。它描述了 NEMO 中使用的四种 DNN 表示(FullPrecision、FakeQuantized、QuantizedDeployable 和 IntegerDeployable),尤其关注后两者的形式化定义。该模型的一个重要特征,特别是 IntegerDeployable 表示,是它能够仅使用整数进行 DNN 推理——在计算的任何部分都不借助实数,也不依赖显式的定点数值表示。

关键词

引用

@article{arxiv.2004.05930,
  title  = {Technical Report: NEMO DNN Quantization for Deployment Model},
  author = {Francesco Conti},
  journal= {arXiv preprint arXiv:2004.05930},
  year   = {2020}
}

备注

12 pages, technical report