中文

FINN-R:用于快速探索量化神经网络的端到端深度学习框架

硬件体系结构 2018-09-13 v1

摘要

卷积神经网络已迅速成为最成功的机器学习算法,使得普适的机器视觉乃至嵌入式计算系统上的智能决策成为可能。尽管底层算术在结构上简单,但计算和存储需求颇具挑战。一个有前景的机会是利用输入、激活值和模型参数的降精度表示。由此在性能、功耗效率和存储占用上的可扩展性,以微小精度损失为代价提供了有趣的设计折衷。FPGA 非常适合利用低精度推理引擎,借助自定义精度实现给定应用所需的数值精度。在本文中,我们描述第二代 FINN 框架,这是一个端到端工具,支持设计空间探索并自动化生成 FPGA 上完全定制的推理引擎。给定神经网络描述,该工具针对给定平台、设计目标和特定精度进行优化。我们引入资源代价函数和性能预测的规范化表述,并详述优化算法。最后,我们在包括 PYNQ 和 AWS F1 在内的多种平台上评估了一系列降精度神经网络,从 CIFAR-10 分类器到基于 YOLO 的目标检测,展示了在 AWS-F1 上 50TOp/s 及嵌入式设备上 5TOp/s 的空前实测吞吐量。

关键词

引用

@article{arxiv.1809.04570,
  title  = {FINN-R: An End-to-End Deep-Learning Framework for Fast Exploration of Quantized Neural Networks},
  author = {Michaela Blott and Thomas Preusser and Nicholas Fraser and Giulio Gambardella and Kenneth O'Brien and Yaman Umuroglu},
  journal= {arXiv preprint arXiv:1809.04570},
  year   = {2018}
}

备注

to be published in ACM TRETS Special Edition on Deep Learning