中文

面向 Xilinx Versal 上深度学习推理的矩阵乘法

分布式、并行与集群计算 2023-02-16 v1 机器学习

摘要

深度神经网络(DNN)对许多人工智能(AI)任务的显著积极影响,促使了各种高性能算法以及专用处理器和加速器的开发。在本文中,我们针对这一情形,论证了传统处理器架构中通用矩阵乘法(GEMM)的现代实现原理,同样适用于在 Xilinx Versal 平台中嵌入的 AI Engine(AIE)瓦片等异质加速器上实现深度学习(DL)中所出现运算的高性能。特别地,我们在 Xilinx Versal VCK190 上对 GEMM 核的原型实现实验结果表明,对于 16 位整数操作数,其性能接近 AIE 瓦片上理论峰值性能的 86.7%。

关键词

引用

@article{arxiv.2302.07594,
  title  = {Toward matrix multiplication for deep learning inference on the Xilinx Versal},
  author = {Jie Lei and José Flich and Enrique S. Quintana-Ortí},
  journal= {arXiv preprint arXiv:2302.07594},
  year   = {2023}
}

备注

11 pages