中文

将 GotoBLAS2 中的并行矩阵乘法映射到 AMD Versal ACAP 用于深度学习

分布式、并行与集群计算 2024-04-24 v1

摘要

本文探讨了针对配备 VC1902 系统级联芯片和多个人工智能引擎(AIE)的 Versal 自适应计算加速平台(ACAP)的并行通用矩阵乘法(GEMM)设计。我们的努力旨在将应用于 CPU 上高性能 GEMM 实现的标准优化技术移植到 Versal ACAP 上。具体而言,我们(1)解决了 Versal ACA 多级存储层次的灵活利用问题;(2)深入研究了 AIE 瓷片中向量单元的高效使用,提出一种针对混合精度算术的面向架构的微内核,以应对深度学习中对自适应精度推理的强大需求;(3)引入一种跨多个 AIE 瓷片的 GEMM 并行设计,以提升计算吞吐量。我们进行了实验性剖析,使用最高可达 32 个 AI 引擎,证明了该解决方案的高并行可扩展性。

关键词

引用

@article{arxiv.2404.15043,
  title  = {Mapping Parallel Matrix Multiplication in GotoBLAS2 to the AMD Versal ACAP for Deep Learning},
  author = {Jie Lei and Enrique S. Quintana-Ortí},
  journal= {arXiv preprint arXiv:2404.15043},
  year   = {2024}
}

备注

12 pages