cuConv:一种用于 CNN 推理的卷积 CUDA 实现
分布式、并行与集群计算
2024-10-28 v1 机器学习
摘要
卷积是基于卷积神经网络(CNN)的深度学习应用的核心操作。当前 GPU 架构在训练和部署深度 CNN 方面效率极高,因此这些架构在生产中被大量用于此目的。然而,现有最优实现在某些常用网络配置下效率不足。本文提出一种基于 GPU 的 CNN 推理卷积操作实现,其有利于合并访存,且无需预先数据变换。实验表明,相对于 cuDNN 中最佳的卷积实现,我们的方案在一系列常见 CNN 前向传播卷积配置中取得了显著的性能提升,加速比最高达 2.29 倍,从而覆盖了现有方法中相关的区域。
引用
@article{arxiv.2103.16234,
title = {cuConv: A CUDA Implementation of Convolution for CNN Inference},
author = {Marc Jordà and Pedro Valero-Lara and Antonio J. Peña},
journal= {arXiv preprint arXiv:2103.16234},
year = {2024}
}
备注
This work has been submitted to the Springer for possible publication