中文

自动化生成低精度深度学习算子

机器学习 2018-10-29 v1 机器学习

摘要

最先进的深度学习模型在计算机视觉与自然语言处理领域取得了稳步进展,代价是模型规模与计算复杂度不断增长。由于低功耗与移动设备的计算能力有限且能耗预算严格,在这些设备上部署此类模型面临挑战。一个引发大量研究兴趣的解决方案是部署高度量化的模型,其以低于八位的低精度输入和权重运行,以精度换取性能。这些模型显著减少了内存占用(最多减少 32 倍),并能在计算密集的卷积层与全连接层中用按位运算替代乘累加。大多数深度学习框架依赖高度工程化的线性代数库(如 ATLAS 或英特尔的 MKL)来实现高效的深度学习算子。迄今为止,流行的深度学习框架均不直接支持低精度算子,部分原因是缺乏优化的低精度库。本文提出一种工作流,可快速生成面向多种 CPU 架构、支持任意精度且包含内存分块与向量化等优化的高性能低精度深度学习算子。我们以低功耗 ARM Cortex-A53 CPU 为例展开详尽的案例研究,展示了如何生成 1 位、2 位卷积,相较优化的 16 位整数基线实现最高 16 倍加速,且比手写实现快 2.3 倍。

关键词

引用

@article{arxiv.1810.11066,
  title  = {Automating Generation of Low Precision Deep Learning Operators},
  author = {Meghan Cowan and Thierry Moreau and Tianqi Chen and Luis Ceze},
  journal= {arXiv preprint arXiv:1810.11066},
  year   = {2018}
}

备注

10 pages, 11 figures