中文

用于深度神经网络准确且内存高效推理的随心配 8 位灵活浮点格式

机器学习 2021-04-27 v3 人工智能

摘要

现代深度神经网络(DNN)模型通常需要海量权重和激活值以实现良好的推理结果。这些数据不可避免地要求巨大的片外内存容量/带宽,若以高精度浮点格式表示,情况更糟。已有工作尝试以不同 8 位浮点格式表示这些数据,然而显著的精度损失仍不可避免。本文引入一种极度灵活的 8 位浮点(FFP8)格式,其定义要素——指数/尾数段的位宽、指数偏置、甚至符号位的有无——均可配置。我们还提出一种方法以恰当确定这些要素,从而最大化模型推理的精度。该方法论的基础基于一个关键观察:在大多数 DNN 模型中,权重与激活值的最大幅值及数值分布均相当不同。实验结果表明,即便无需模型重训练,所提 FFP8 格式在多个代表性图像分类模型上仍实现了 0.1%0.3%0.1\%\sim 0.3\% 的极低精度损失。此外,将经典浮点处理单元改造为兼容 FFP8 的单元十分容易,且额外硬件开销微小。

关键词

引用

@article{arxiv.2104.07329,
  title  = {All-You-Can-Fit 8-Bit Flexible Floating-Point Format for Accurate and Memory-Efficient Inference of Deep Neural Networks},
  author = {Cheng-Wei Huang and Tim-Wei Chen and Juinn-Dar Huang},
  journal= {arXiv preprint arXiv:2104.07329},
  year   = {2021}
}