基于 hls4ml 在 FPGA 上实现快速卷积神经网络
机器学习
2021-07-19 v2 计算机视觉与模式识别
高能物理 - 实验
仪器与探测器
机器学习
摘要
我们介绍了一款自动化工具,用于在 FPGA 上部署具有卷积层的超低延迟、低功耗深度神经网络。通过扩展 hls4ml 库,我们利用卷积架构展示了 s 的推理延迟,面向诸如 CERN 大型强子对撞机上的那些微秒级延迟应用。考虑到在街景门牌号数据集(Street View House Numbers Dataset)上训练的基准模型,我们展示了多种模型压缩方法,以适配粒子探测器触发与数据采集系统中典型 FPGA 器件的计算约束。特别地,我们讨论了剪枝与量化感知训练,并展示了如何在模型精度几乎无损失的情况下显著减少资源利用率。我们表明,在模型精度零损失的情况下,FPGA 关键资源消耗可降低 97%;在容忍 6% 精度下降时,可降低 99%。
引用
@article{arxiv.2101.05108,
title = {Fast convolutional neural networks on FPGAs with hls4ml},
author = {Thea Aarrestad and Vladimir Loncar and Nicolò Ghielmetti and Maurizio Pierini and Sioni Summers and Jennifer Ngadiuba and Christoffer Petersson and Hampus Linander and Yutaro Iiyama and Giuseppe Di Guglielmo and Javier Duarte and Philip Harris and Dylan Rankin and Sergo Jindariani and Kevin Pedro and Nhan Tran and Mia Liu and Edward Kreinar and Zhenbin Wu and Duc Hoang},
journal= {arXiv preprint arXiv:2101.05108},
year = {2021}
}
备注
18 pages, 18 figures, 4 tables