面向 Xilinx Versal 上深度学习推理的矩阵乘法
分布式、并行与集群计算
2023-02-16 v1 机器学习
摘要
深度神经网络(DNN)对许多人工智能(AI)任务的显著积极影响,促使了各种高性能算法以及专用处理器和加速器的开发。在本文中,我们针对这一情形,论证了传统处理器架构中通用矩阵乘法(GEMM)的现代实现原理,同样适用于在 Xilinx Versal 平台中嵌入的 AI Engine(AIE)瓦片等异质加速器上实现深度学习(DL)中所出现运算的高性能。特别地,我们在 Xilinx Versal VCK190 上对 GEMM 核的原型实现实验结果表明,对于 16 位整数操作数,其性能接近 AIE 瓦片上理论峰值性能的 86.7%。
引用
@article{arxiv.2302.07594,
title = {Toward matrix multiplication for deep learning inference on the Xilinx Versal},
author = {Jie Lei and José Flich and Enrique S. Quintana-Ortí},
journal= {arXiv preprint arXiv:2302.07594},
year = {2023}
}
备注
11 pages