中文

Benanza:自动生成微基准以计算“下界”延迟并指导 GPU 上深度学习模型的优化

机器学习 2020-06-04 v3 分布式、并行与集群计算 性能 机器学习

摘要

随着深度学习(DL)模型在延迟敏感型应用中的使用日益增多,人们越来越关注改善其响应时间。此类改进的一个重要途径是对这些模型的执行进行剖析并刻画其性能,以识别可能的优化机会。然而,当前的剖析工具缺乏高度期望的能力来刻画理想性能、识别低效来源并量化潜在优化的收益。这些不足导致缓慢的刻画/优化周期,无法跟上新 DL 模型引入的快速节奏。我们提出 Benanza,一种可持续且可扩展的基准测试与分析设计,可加速 GPU 上 DL 模型的刻画/优化周期。Benanza 由四个主要组件构成:将模型解析为内部表示的模型处理器、在给定一组模型时自动生成微基准的可配置基准生成器、基准结果数据库,以及利用基准数据计算 DL 模型的“下界”延迟并指导模型执行优化的分析器。“下界”延迟度量估计了 GPU 系统上的理想模型执行,并作为识别框架或系统库中优化机会的基础。我们使用 Benanza 在从 Kepler 到最新 Turing 的 7 款 GPU 上评估了 MXNet、ONNX Runtime 和 PyTorch 中的 30 个 ONNX 模型,并识别了并行层执行、cuDNN 卷积算法选择、框架低效、层融合以及使用 Tensor Cores 方面的优化。

关键词

引用

@article{arxiv.1911.06922,
  title  = {Benanza: Automatic $\mu$Benchmark Generation to Compute "Lower-bound" Latency and Inform Optimizations of Deep Learning Models on GPUs},
  author = {Cheng Li and Abdul Dakkak and Jinjun Xiong and Wen-mei Hwu},
  journal= {arXiv preprint arXiv:1911.06922},
  year   = {2020}
}