中文

TBD:深度神经网络训练的基准测试与分析

机器学习 2018-04-17 v2 机器学习

摘要

深度神经网络(DNN)近期的普及引发了人们对高效执行 DNN 相关计算的极大研究兴趣。然而,其主要关注点通常非常狭窄,仅限于 (i) 推理——即如何高效执行已训练的模型,以及 (ii) 将图像分类网络作为评估的主要基准。我们在这项工作中的主要目标是打破这种短视观点,具体方式为 (i) 提出一个名为 TBD(TBD 是 Training Benchmark for DNNs 的缩写)的 DNN 训练新基准,该基准使用一组涵盖广泛机器学习应用领域的代表性 DNN 模型:图像分类、机器翻译、语音识别、目标检测、对抗网络和强化学习;以及 (ii) 在三种主要深度学习框架(TensorFlow、MXNet、CNTK)和不同硬件配置(单 GPU、多 GPU 和多机)下,对这些不同应用的训练进行广泛的性能分析。TBD 目前涵盖六个主要应用领域和八种不同的 SOTA 模型。我们为这些模型提出了一种新的性能分析工具链,它结合了对现有性能分析工具的针对性使用、对新旧指标与分析方法的精心选择,以及对 DNN 训练领域特定特征的利用。我们还在所有三种主要框架中构建了一套新的内存分析工具;这些急需的工具最终能够准确揭示在 DNN 训练中不同数据结构(权重、激活值、梯度、工作空间)究竟消耗了多少内存。通过使用我们的工具和方法,我们得出了若干重要观察结果,并对未来 DNN 训练的研究和优化应聚焦的方向提出了建议。

关键词

引用

@article{arxiv.1803.06905,
  title  = {TBD: Benchmarking and Analyzing Deep Neural Network Training},
  author = {Hongyu Zhu and Mohamed Akrout and Bojian Zheng and Andrew Pelegris and Amar Phanishayee and Bianca Schroeder and Gennady Pekhimenko},
  journal= {arXiv preprint arXiv:1803.06905},
  year   = {2018}
}