Synetgy:面向嵌入式FPGA上卷积网络加速器的算法-硬件协同设计
计算机视觉与模式识别
2020-05-12 v4 硬件体系结构
摘要
近年来,使用FPGA加速ConvNet引起了显著关注。然而,FPGA加速器设计尚未利用ConvNet的最新进展。结果,诸如每秒帧数(FPS)等关键应用特性被忽视,仅简单统计GOPs,而对应用成功至关重要的准确率结果往往甚至未予报告。本工作中,我们采用算法-硬件协同设计方法开发了称为Synetgy的ConvNet加速器和一种称为DiracDeltaNet的新型ConvNet模型。加速器和ConvNet均针对FPGA需求定制。顾名思义,DiracDeltaNet是一种仅含卷积、而空间卷积被更高效移位操作替代的ConvNet。DiracDeltaNet在ImageNet上取得了具竞争力的准确率(top-5为88.7%),但参数比VGG16少42、操作数少48。我们进一步将DiracDeltaNet的权重量化为4-bit、激活量化为4-bit,准确率损失小于1%。这些量化很好地利用了FPGA硬件的特性。简言之,DiracDeltaNet的小模型尺寸、低计算操作数、低精度及简化算子使我们能为FPGA协同设计高度定制化的计算单元。我们通过高层次综合在Ultra96 SoC系统上实现了DiracDeltaNet的计算单元。我们的加速器在ImageNet上最终的top-5准确率为88.1%,高于所有此前报道的嵌入式FPGA加速器。此外,该加速器在ImageNet分类任务上达到66.3 FPS的推理速度,以至少11.6的优势超越具有相似准确率的已有工作。
引用
@article{arxiv.1811.08634,
title = {Synetgy: Algorithm-hardware Co-design for ConvNet Accelerators on Embedded FPGAs},
author = {Yifan Yang and Qijing Huang and Bichen Wu and Tianjun Zhang and Liang Ma and Giulio Gambardella and Michaela Blott and Luciano Lavagno and Kees Vissers and John Wawrzynek and Kurt Keutzer},
journal= {arXiv preprint arXiv:1811.08634},
year = {2020}
}
备注
Update to the latest results