技术报告:用于部署模型的 NEMO DNN 量化
机器学习
2020-04-14 v1 人工智能
神经与进化计算
机器学习
摘要
本技术报告旨在为深度神经网络(DNN)逐层量化定义一个形式化框架,特别关注与最终部署相关的问题。它同时作为 NEMO(NEural Minimization for pytOrch)框架的文档。它描述了 NEMO 中使用的四种 DNN 表示(FullPrecision、FakeQuantized、QuantizedDeployable 和 IntegerDeployable),尤其关注后两者的形式化定义。该模型的一个重要特征,特别是 IntegerDeployable 表示,是它能够仅使用整数进行 DNN 推理——在计算的任何部分都不借助实数,也不依赖显式的定点数值表示。
引用
@article{arxiv.2004.05930,
title = {Technical Report: NEMO DNN Quantization for Deployment Model},
author = {Francesco Conti},
journal= {arXiv preprint arXiv:2004.05930},
year = {2020}
}
备注
12 pages, technical report