Phoenix:一种面向低精度浮点量化的卷积神经网络架构
信号处理
2020-03-06 v1 图像与视频处理
摘要
卷积神经网络(CNNs)以变得更深更大为代价取得了最先进的性能。尽管量化(定点与浮点均有)已被证明能有效减少存储与内存访问,但两个挑战——1)对深层CNN量化若无校准、微调或重训练而引起的精度损失,以及2)浮点量化引起的硬件低效——阻碍了处理器充分利用其收益。本文提出一种面向低精度浮点量化的处理器Phoenix以应对上述挑战。我们有三个关键发现:1)8位浮点量化比8位定点量化误差更小;2)量化前做归一化,无需任何校准、微调或重训练技术,可进一步降低精度退化;3)若采用全精度乘积,8位浮点乘法器比8位定点乘法器具有更高的硬件效率。基于这些关键发现,我们提出一种面向归一化的8位浮点量化方法,以可忽略的精度损失(top-1/top-5精度分别 within 0.5%/0.3%)减少存储与内存访问。我们进一步设计硬件处理器以解决浮点乘法器导致的硬件低效。与最先进加速器相比,Phoenix在相同核面积下对AlexNet和VGG16的性能分别优3.32倍和7.45倍。
引用
@article{arxiv.2003.02628,
title = {Phoenix: A Low-Precision Floating-Point Quantization Oriented Architecture for Convolutional Neural Networks},
author = {Chen Wu and Mingyu Wang and Xiayu Li and Jicheng Lu and Kun Wang and Lei He},
journal= {arXiv preprint arXiv:2003.02628},
year = {2020}
}
备注
14 pages, 18 figures, submitted to TVLSI