面向 AI 训练的 AI 加速器性能与能效基准测试
分布式、并行与集群计算
2020-10-12 v9 机器学习
摘要
深度学习已广泛应用于复杂的 AI 应用。然而,训练深度神经网络(DNNs)模型需要大量计算、较长运行时间和较高能耗。如今,多核 AI 加速器(如 GPU 和 TPU)被设计用于提升 AI 训练性能。然而,不同厂商的处理器在性能和能耗方面表现各异。为调查若干流行商用现货处理器(即 Intel CPU、NVIDIA GPU、AMD GPU 和 Google TPU)在训练 DNNs 时的差异,我们通过基准测试一组具代表性的深度学习工作负载(包括计算密集型操作、经典卷积神经网络(CNNs)、循环神经网络(LSTM)、Deep Speech 2 和 Transformer)对这些处理器的性能与能效开展了全面的实证研究。与仅呈现训练时间的现有端到端基准测试不同,我们试图考察硬件、厂商软件库以及深度学习框架对 AI 训练性能和能耗的影响。我们的评估方法与结果不仅为终端用户选择恰当的 AI 加速器提供了信息性指南,也揭示了硬件厂商改进其软件库的一些机会。
引用
@article{arxiv.1909.06842,
title = {Benchmarking the Performance and Energy Efficiency of AI Accelerators for AI Training},
author = {Yuxin Wang and Qiang Wang and Shaohuai Shi and Xin He and Zhenheng Tang and Kaiyong Zhao and Xiaowen Chu},
journal= {arXiv preprint arXiv:1909.06842},
year = {2020}
}
备注
Revised some minor issues