中文

cuConv:一种用于 CNN 推理的卷积 CUDA 实现

分布式、并行与集群计算 2024-10-28 v1 机器学习

摘要

卷积是基于卷积神经网络(CNN)的深度学习应用的核心操作。当前 GPU 架构在训练和部署深度 CNN 方面效率极高,因此这些架构在生产中被大量用于此目的。然而,现有最优实现在某些常用网络配置下效率不足。本文提出一种基于 GPU 的 CNN 推理卷积操作实现,其有利于合并访存,且无需预先数据变换。实验表明,相对于 cuDNN 中最佳的卷积实现,我们的方案在一系列常见 CNN 前向传播卷积配置中取得了显著的性能提升,加速比最高达 2.29 倍,从而覆盖了现有方法中相关的区域。

关键词

引用

@article{arxiv.2103.16234,
  title  = {cuConv: A CUDA Implementation of Convolution for CNN Inference},
  author = {Marc Jordà and Pedro Valero-Lara and Antonio J. Peña},
  journal= {arXiv preprint arXiv:2103.16234},
  year   = {2024}
}

备注

This work has been submitted to the Springer for possible publication