利用稀疏性与模式的高性能卷积用于深度卷积神经网络推理
计算机视觉与模式识别
2021-04-20 v1
摘要
部署深度卷积神经网络(CNNs)受其内存占用与速度要求的影响,而这些主要源自卷积。广泛使用的卷积算法 im2col 与 MEC 通过冗余存储激活图中包含于水平及/或垂直核重叠处的元素来生成降维矩阵,而未考虑图的稀疏性。利用图的稀疏性,本文提出两种新卷积算法,称为压缩模式重叠(CPO)与压缩模式集(CPS),它们在保持精度的同时降低内存占用并提升推理速度。CPO 识别激活图水平与垂直重叠处的非零元素(NZEs)。CPS 通过压缩相邻 NZEs 的索引位置进一步改善 CPO 的内存节省。两种算法均跳过全零的激活图通道/区域。随后,CPO/CPS 通过其稀疏表示上的稀疏矩阵-向量乘法(SpMv)执行卷积。在 CPU 上进行的实验结果表明,相较于 im2col,平均逐层时间节省达 63%,压缩比(CR)达 26 倍。在某些层中,我们的平均逐层 CPO/CPS 时间节省优于 MEC 的并行实现 28%,CR 优 9.2 倍。对于给定的 CNN 推理,我们离线为每个卷积层在 CPO 或 CPS 与 im2col 之间按时间最优选取最佳卷积算法。我们的算法在多达 56% 的非逐点卷积层中被选中。我们的离线选取带来最高 9% 的 CNN 推理时间节省与最高 10 倍的 CR。
引用
@article{arxiv.2104.08314,
title = {High Performance Convolution Using Sparsity and Patterns for Inference in Deep Convolutional Neural Networks},
author = {Hossam Amer and Ahmed H. Salamah and Ahmad Sajedi and En-hui Yang},
journal= {arXiv preprint arXiv:2104.08314},
year = {2021}
}
备注
34 pages