ShortcutFusion:从 TensorFlow 到基于 FPGA 的加速器,带复用感知的捷径数据内存分配
分布式、并行与集群计算
2022-03-08 v4 硬件体系结构
摘要
残差块是近期 SOTA CNN(如 EfficientNet 或 EfficientDet)中非常常见的组件。在 ResNet152 中,捷径数据占特征图访问的近 40% [8]。以往大多数 DNN 编译器与加速器忽视了捷径数据的优化。本文提出 ShortcutFusion,一种面向基于 FPGA 的加速器的优化工具,采用复用感知的静态内存分配处理捷径数据,以在资源约束下最大化片上数据复用。从 TensorFlow DNN 模型出发,所提设计为一组网关节点生成指令集,这些节点对每个残差块使用优化的数据复用。在 Xilinx KCU1500 FPGA 卡上实现的加速器设计,对于 256x256 输入尺寸,比 NVIDIA RTX 2080 Ti 快 2.8 倍且能效高 9.9 倍。与基线结果(其中权重、输入和输出每层恰好从片外内存访问一次)相比,ShortcutFusion 为 RetinaNet、Yolov3、ResNet152 和 EfficientNet 减少了 47.8–84.8% 的 DRAM 访问。在缓冲大小与同样在硬件中挖掘捷径数据的 ShortcutMining [8] 相近的情况下,本工作将特征图的片外访问减少 5.27 倍,同时权重恰好从片外内存访问一次。
引用
@article{arxiv.2106.08167,
title = {ShortcutFusion: From Tensorflow to FPGA-based accelerator with reuse-aware memory allocation for shortcut data},
author = {Duy Thanh Nguyen and Hyeonseung Je and Tuan Nghia Nguyen and Soojung Ryu and Kyujoong Lee and Hyuk-Jae Lee},
journal= {arXiv preprint arXiv:2106.08167},
year = {2022}
}
备注
Accepted for publication in IEEE Transaction on Circuits and Systems I: Regular Papers