小规模 systolic 阵列上的稀疏 Winograd 卷积神经网络
分布式、并行与集群计算
2018-10-05 v1 人工智能
机器学习
摘要
FPGA 上的可重构性、能效和大规模并行性使其成为实现高效深度学习加速器的最佳选择之一。然而,最先进的实现很少考虑计算能力的高吞吐量与存储子系统支持该吞吐量的能力之间的平衡。在本文中,我们通过在 FPGA 上结合稀疏 Winograd 卷积、小规模 systolic 阵列集群以及定制的内存布局设计,实现了一个加速器。我们还提供了针对通用 Winograd 卷积算法的解析模型分析作为设计参考。在 VGG16 上的实验结果表明,与稠密实现相比,它实现了非常高的计算资源利用率、20 倍至 30 倍的能效以及超过 5 倍的速度提升。
引用
@article{arxiv.1810.01973,
title = {Sparse Winograd Convolutional neural networks on small-scale systolic arrays},
author = {Feng Shi and Haochen Li and Yuhe Gao and Benjamin Kuschner and Song-Chun Zhu},
journal= {arXiv preprint arXiv:1810.01973},
year = {2018}
}
备注
submitted to FPGA 2019