FINN:一种用于快速、可扩展二值化神经网络推理的框架
计算机视觉与模式识别
2016-12-22 v1 硬件体系结构
机器学习
摘要
研究表明卷积神经网络包含显著冗余,即使将权重和激活从浮点缩减为二进制值,也能获得高分类准确率。在本文中,我们提出FINN,一个使用灵活异构流架构构建快速灵活FPGA加速器的框架。通过利用一组能够实现二值化神经网络到硬件高效映射的新优化,我们实现了全连接、卷积和池化层,每层计算资源根据用户提供的吞吐量需求定制。在总系统功耗低于25 W的ZC706嵌入式FPGA平台上,我们在MNIST数据集上以95.8%准确率展示了每秒最高1230万次图像分类、0.31微秒延迟,在CIFAR-10和SVHN数据集上分别以80.1%和94.9%准确率展示每秒21906次图像分类、283微秒延迟。据我们所知,这是迄今为止在这些基准上报道的最快分类速率。
引用
@article{arxiv.1612.07119,
title = {FINN: A Framework for Fast, Scalable Binarized Neural Network Inference},
author = {Yaman Umuroglu and Nicholas J. Fraser and Giulio Gambardella and Michaela Blott and Philip Leong and Magnus Jahre and Kees Vissers},
journal= {arXiv preprint arXiv:1612.07119},
year = {2016}
}
备注
To appear in the 25th International Symposium on Field-Programmable Gate Arrays, February 2017