中文

Woodpecker-DL:通过硬件感知的多方面优化加速深度神经网络

分布式、并行与集群计算 2020-08-12 v1 机器学习

摘要

加速深度模型训练与推理在实践中至关重要。现有深度学习框架通常集中于优化训练速度,较少关注推理专用优化。实际上,模型推理在计算上与训练不同,例如训练期间参数在每个梯度更新步被刷新,而推理期间保持不变。模型推理的这些特殊特性为其优化开启了新机会。本文中,我们提出一种硬件感知优化框架,即 Woodpecker-DL(WPK),通过从图优化、自动搜索、领域特定语言(DSL)编译器技术和系统级探索角度利用多重联合优化来加速推理。在 WPK 中,我们研究了两种分别基于遗传算法和强化学习的新自动搜索方法,以针对特定硬件搜寻最佳算子代码配置。一个定制的 DSL 编译器进一步附加到这些搜索算法上以生成高效代码。为创建优化推理方案,WPK 系统性地探索来自第三方库的高速算子实现以及我们自动生成的代码,并为每个算子选出最佳实现使用。大量实验表明,在 Tesla P100 GPU 上,单个卷积算子我们可实现相对于 cuDNN 最大 5.40 倍、相对于 TVM 最大 1.63 倍的加速,且端到端模型推理比 TensorRT 快至多 1.18 倍。

关键词

引用

@article{arxiv.2008.04567,
  title  = {Woodpecker-DL: Accelerating Deep Neural Networks via Hardware-Aware Multifaceted Optimizations},
  author = {Yongchao Liu and Yue Jin and Yong Chen and Teng Teng and Hang Ou and Rui Zhao and Yao Zhang},
  journal= {arXiv preprint arXiv:2008.04567},
  year   = {2020}
}

备注

10 pages, 3 figures