中文

MG3MConv:面向 SW26010 处理器的多粒度矩阵乘映射卷积算法

分布式、并行与集群计算 2023-07-12 v1

摘要

作为人工智能应用的核心,卷积研究已成为高性能计算中的热点。随着新兴 SW26010 处理器在人工智能领域的快速发展,迫切需要在该处理器上实现高性能卷积算法。然而,当前 SW26010 对卷积的支持仍很初步。仅有研究提供了充足的运行峰值性能,但缺乏对各类卷积场景的适应性。为完善 SW26010 上的卷积算法,我们提出一种称为 MG3MConv 的多粒度矩阵乘映射卷积算法,其面向 SW26010 的体系结构特征。MG3MConv 基于本文提出的线程块概念,支持卷积任务的多样化映射方案。所有面向体系结构的优化方法均从四个层级精心设计并充分挖掘 SW26010 的硬件效率。实验表明,MG3MConv 的硬件效率最高可达 84.78%,是基于 NVIDIA K80m GPU 的 cuDNN 的 1.75 倍。此外,MG3MConv 在多数卷积场景中优于 cuDNN。我们还以六种代表性 CNN 作为真实案例,MG3MConv 在 VGG 网络模型上的硬件效率达 67.04%,分别为 cuDNN 与 swDNN 的 1.37 倍与 1.96 倍。

关键词

引用

@article{arxiv.2307.04941,
  title  = {MG3MConv: Multi-Grained Matrix-Multiplication-Mapping Convolution Algorithm toward the SW26010 Processor},
  author = {Zheng Wu},
  journal= {arXiv preprint arXiv:2307.04941},
  year   = {2023}
}