中文

面向领域优化的深度学习加速器的全栈搜索技术

机器学习 2022-02-02 v3 硬件体系结构 性能

摘要

快速变化的深度学习格局为构建针对特定数据中心规模工作负载优化的推理加速器提供了独特机遇。我们提出全栈加速器搜索技术(FAST),一种硬件加速器搜索框架,其定义了一个涵盖硬件—软件栈中关键设计决策的广泛优化环境,包括硬件数据通路、软件调度以及编译器流程(如算子融合和张量填充)。在本文中,我们分析最先进的视觉和自然语言处理(NLP)模型(包括 EfficientNet 和 BERT)中的瓶颈,并使用 FAST 设计能够解决这些瓶颈的加速器。针对单一工作负载优化的 FAST 生成加速器在所有基准测试上相比 TPU-v3 平均将性能/功耗(Perf/TDP)提升 3.7 倍。针对服务一组工作负载优化的 FAST 生成加速器相比 TPU-v3 平均将 Perf/TDP 提升 2.4 倍。我们的投资回报分析表明,FAST 生成的加速器对于中等规模的数据中心部署可能具有实用性。

关键词

引用

@article{arxiv.2105.12842,
  title  = {A Full-Stack Search Technique for Domain Optimized Deep Learning Accelerators},
  author = {Dan Zhang and Safeen Huda and Ebrahim Songhori and Kartik Prabhu and Quoc Le and Anna Goldie and Azalia Mirhoseini},
  journal= {arXiv preprint arXiv:2105.12842},
  year   = {2022}
}

备注

Fixed typo