Intel Max 系列 GPU 上深度学习稀疏矩阵核的性能优化
机器学习
2023-11-02 v1 数学软件
摘要
在本文中,我们关注与机器学习应用相关的三种稀疏矩阵运算,即稀疏-稠密矩阵乘法(SPMM)、采样稠密-稠密矩阵乘法(SDDMM),以及 SDDMM 与 SPMM 的组合(也称为 FusedMM)。我们利用 Intel oneAPI 的显式 SIMD(ESIMD)SYCL 扩展 API 为 SPMM、SDDMM 和 FusedMM 运算开发了优化实现。与 CUDA 或 SYCL 不同,ESIMD API 支持编写显式向量化的核代码。使用 ESIMD API 实现的稀疏矩阵算法性能接近目标 Intel 数据中心 GPU 的峰值。我们将性能结果与 Intel GPU 上的 Intel oneMKL 库以及 NVIDIA V100 GPU 上近期针对稀疏矩阵运算的 CUDA 实现进行比较,表明我们的稀疏矩阵运算实现优于二者。
引用
@article{arxiv.2311.00368,
title = {Performance Optimization of Deep Learning Sparse Matrix Kernels on Intel Max Series GPU},
author = {Mohammad Zubair and Christoph Bauinger},
journal= {arXiv preprint arXiv:2311.00368},
year = {2023}
}
备注
20 pages, 1 Table, 19 Figures, preprint