中文

在广泛使用的移动端CPU上高效实现Winograd或Cook-Toom卷积核

机器学习 2019-03-06 v1 新兴技术

摘要

Winograd或Cook-Toom类算法有助于降低许多现代深度卷积神经网络(CNN)的整体计算复杂度。尽管在CNN的模型和算法优化方面已有大量研究,但很少有关注这些算法在嵌入式CPU上的高效实现,此类CPU通常内存极为有限且功耗预算很低。本文旨在填补这一空白,聚焦于在现代Arm Cortex-A CPU(当今移动设备中广泛使用的处理器)上高效实现基于Winograd或Cook-Toom的卷积。具体而言,我们通过采用一组提升计算资源利用率的优化策略,并有效利用ARMv8-A NEON SIMD指令集,展示了推理延迟的降低。我们在Arm Cortex-A73平台上使用多个代表性CNN评估了所提出的分区域多通道实现。结果表明,相较于现有的基于im2row/im2col的优化技术,全网络性能显著提升,最高达60%。

关键词

引用

@article{arxiv.1903.01521,
  title  = {Efficient Winograd or Cook-Toom Convolution Kernel Implementation on Widely Used Mobile CPUs},
  author = {Partha Maji and Andrew Mundy and Ganesh Dasika and Jesse Beu and Matthew Mattina and Robert Mullins},
  journal= {arXiv preprint arXiv:1903.01521},
  year   = {2019}
}

备注

HPCA.EMC2 Feb 17, 2019