SIMD架构上高性能深度学习卷积的解剖
神经与进化计算
2018-08-17 v1 数据结构与算法
摘要
卷积层在许多类深度神经网络中十分普遍,包括卷积神经网络(CNNs),其在图像识别、神经机器翻译和语音识别等任务上提供了最先进的结果。卷积操作的计算昂贵性质导致了包括矩阵-矩阵乘法公式化以及主要针对GPU的直接卷积在内的多种实现的扩散。在本文中,我们为x86架构(特别是Xeon和XeonPhi系统)引入了直接卷积核,其通过动态编译方法实现。我们基于JIT的实现显示出接近理论峰值性能,具体取决于设置和手头的CPU架构。我们进一步展示了这些JIT优化核如何集成到一个轻量级多节点图执行模型中。这说明了在CPU上执行最先进图像识别任务时,单节点和多节点运行产生了高效率和高的图像吞吐量。
引用
@article{arxiv.1808.05566,
title = {The linear hidden subset problem for the (1+1) EA with scheduled and adaptive mutation rates},
author = {Hafsteinn Einarsson and Marcelo Matheus Gauy and Johannes Lengler and Florian Meier and Asier Mujika and Angelika Steger and Felix Weissenberger},
journal= {arXiv preprint arXiv:1808.05566},
year = {2018}
}