中文

商业矩阵乘法加速器上隐式卷积算法的表征与揭秘

分布式、并行与集群计算 2021-10-11 v1

摘要

当今许多深度神经网络加速器,如 Google 的 TPU 与 NVIDIA 的 tensor core,均围绕加速通用矩阵乘法(即 GEMM)构建。然而,在基于 GEMM 的加速器上支持卷积并非易事。朴素方法将卷积显式降级为 GEMM,俗称 im2col,会带来显著的性能与内存开销。现有隐式 im2col 算法需要不可扩展的硬件,且在支持步长卷积等重要卷积变体时效率低下。本文提出一种由 Google TPU 采用的、内存高效且硬件友好的隐式 im2col 算法,其将卷积动态转换为 GEMM, practically 零性能与内存开销,充分释放 GEMM 引擎的算力。通过全面的实验结果,我们定量论证该算法已被商业闭源平台采用,且我们首次描述了其高层思路与实现细节。最后,我们表明该算法亦可普遍应用于 Nvidia 的 Tensor Cores (TC),匹配并超越 TC 上实测性能。

关键词

引用

@article{arxiv.2110.03901,
  title  = {Characterizing and Demystifying the Implicit Convolution Algorithm on Commercial Matrix-Multiplication Accelerators},
  author = {Yangjie Zhou and Mengtian Yang and Cong Guo and Jingwen Leng and Yun Liang and Quan Chen and Minyi Guo and Yuhao Zhu},
  journal= {arXiv preprint arXiv:2110.03901},
  year   = {2021}
}