中文

面向 FPGA 上快速且高能效的二值化神经网络推理

机器学习 2018-10-05 v1 人工智能 硬件体系结构 计算机视觉与模式识别 机器学习

摘要

二值化神经网络(BNN)通过使用单比特(-1/+1)表示网络参数与中间表征,消除了经典 CNN 中的位宽冗余,大幅降低了片外数据传输与存储开销。然而,BNN 推理中仍存在大量计算冗余。通过分析图像的局部特性与学到的 BNN 核权重,我们在常用网络架构中观测到由所提度量衡量的核间平均约 78% 的输入相似度与约 59% 的权重相似度。因此确实存在可被利用以进一步减少片上计算量的冗余。受此观察启发,本文提出两类快速且高能效的 BNN 推理架构。我们还提供分析与见解,以针对不同数据集与网络模型选取两者中更优的策略。通过复用先前计算的结果,可跳过大量用于数据缓冲访问与计算的周期。实验表明,利用 BNN 相似性可跳过 80% 的计算与 40% 的缓冲访问。因此,相较未采用复用技术的基线,我们的设计可实现总功耗降低 17%、片内功耗降低 54% 以及最高 2.4× 的加速比。我们的设计相较最先进的 BNN 推理设计还展现出 1.9× 的面积效率提升。我们相信 BNN 在 FPGA 上的部署为在移动设备上运行深度学习模型开辟了可期前景。

关键词

引用

@article{arxiv.1810.02068,
  title  = {Towards Fast and Energy-Efficient Binarized Neural Network Inference on FPGA},
  author = {Cheng Fu and Shilin Zhu and Hao Su and Ching-En Lee and Jishen Zhao},
  journal= {arXiv preprint arXiv:1810.02068},
  year   = {2018}
}