中文

cuDNN:高效深度学习原语

神经与进化计算 2014-12-19 v3 机器学习 数学软件

摘要

我们提出了一套高效的深度学习原语实现库。深度学习工作负载计算密集,其内核优化困难且耗时。随着并行架构的演进,内核必须重新优化,这使得代码库的长期维护变得困难。高性能计算(HPC)社区早已通过基础线性代数子程序(BLAS)等库解决了类似问题,但深度学习领域尚无此类库。缺乏此类库意味着在并行处理器上实现深度学习工作负载的研究人员必须自行创建并优化主要计算内核的实现,且每当新型并行处理器出现时,这项工作就必须重复进行。为解决这一问题,我们创建了一个意图类似于 BLAS 的库,包含针对深度学习工作负载优化的例程。我们的实现包含针对 GPU 的例程,尽管与 BLAS 库类似,这些例程也可在其他平台上实现。该库易于集成到现有框架中,并提供优化的性能和内存使用。例如,将 cuDNN 集成到流行的卷积网络框架 Caffe 中,在标准模型上性能提升了 36%,同时降低了内存消耗。

关键词

引用

@article{arxiv.1410.0759,
  title  = {cuDNN: Efficient Primitives for Deep Learning},
  author = {Sharan Chetlur and Cliff Woolley and Philippe Vandermersch and Jonathan Cohen and John Tran and Bryan Catanzaro and Evan Shelhamer},
  journal= {arXiv preprint arXiv:1410.0759},
  year   = {2014}
}