Bolt:弥合自动调优器与硬件原生性能之间的鸿沟
分布式、并行与集群计算
2021-10-29 v1 人工智能
摘要
当今的自动调优器(如 AutoTVM、Ansor)通过在大搜索空间中导航以识别高效实现来生成张量程序,但它们对硬件细节不透明。因此,其性能可能落后于硬件原生库(如 cuBLAS、cuDNN),后者由设备供应商手工优化以榨取高性能。另一方面,这些供应商库支持的函数固定,且缺乏自动调优器所提供的定制与自动化支持。Bolt 基于近期趋势:供应商库正日益模块化并通过声明式控制(如 CUTLASS)可重配置。它实现了一种弥合此鸿沟、兼得两者之长的新方法,即通过硬件原生模板化搜索。Bolt 为在图、算子与模型层面重新思考端到端张量优化提供了新机遇。Bolt 通过在 TVM 这一流行自动调优器与一类广泛使用的平台(即 NVIDIA GPU)——二者均在我们生产环境中大规模部署——上原型化来展示该概念。Bolt 将常见卷积神经网络推理速度较最先进水平平均提升 2.5 倍,并在 20 分钟内完成这些模型的自动调优。
引用
@article{arxiv.2110.15238,
title = {Bolt: Bridging the Gap between Auto-tuners and Hardware-native Performance},
author = {Jiarong Xing and Leyuan Wang and Shang Zhang and Jack Chen and Ang Chen and Yibo Zhu},
journal= {arXiv preprint arXiv:2110.15238},
year = {2021}
}