中文

通过协同设计在长向量架构上加速 CNN 推理

分布式、并行与集群计算 2022-12-23 v1

摘要

基于 CPU 的推理可作为片外加速器的替代方案,而向量架构因其高效性成为有前景的选择。然而,卷积算法与硬件实现的巨大设计空间使得选择最佳选项颇具挑战。本文介绍针对基于 CPU 的 CNN 推理进行向量架构协同设计的正在进行的研究,聚焦于 im2col+GEMM 与 Winograd 核。使用 Gem5 模拟器,我们考察多种硬件微体系结构特征对 RISC-V Vector 与 ARM-SVE 指令集架构的影响。我们还研究了若干类 BLIS 的算法优化对 im2col+GEMM 的影响。我们的协同设计研究表明,相较于 512 位向量长度与 1MB L2 缓存,更长的向量长度与更大的缓存配合优化后的 CNN 核可将性能提升 5 倍。对于 Winograd,我们提出一种利用更长向量长度并提供高内存复用的块间并行化新方法,对核大小为 3x3 的非步长卷积层带来最高 2.4 倍的性能提升。我们的研究还表明 Winograd 相比 im2col+GEMM 需要更小的缓存尺寸。

关键词

引用

@article{arxiv.2212.11574,
  title  = {Accelerating CNN inference on long vector architectures via co-design},
  author = {Sonia Rani Gupta and Nikela Papadopoulou and Miquel Pericas},
  journal= {arXiv preprint arXiv:2212.11574},
  year   = {2022}
}

备注

To appear at IPDPS 2023