DAWNBench 时间到精度机器学习性能基准的分析
机器学习
2019-12-03 v2 机器学习
摘要
研究人员已提出硬件、软件和算法优化以提升深度学习的计算性能。虽然其中一些优化更快地执行相同操作(例如提高 GPU 时钟速度),但许多其他优化修改了训练过程的语义(例如降低精度),并可能影响最终模型在未见数据上的精度。由于缺乏考虑这些权衡的标准评估准则,难以直接比较这些优化。为解决这个问题,我们最近引入了 DAWNBench,一个聚焦于在未见数据集上达到近最先进精度的端到端训练时间的基准竞赛——一种称为时间到精度 (TTA) 的综合指标。在这项工作中,我们分析了来自 DAWNBench 的参赛作品(其收到了来自多个工业集团的优化提交),以研究 TTA 作为指标的行为以及表现最佳参赛作品的趋势。我们表明 TTA 具有低变异系数,且为 TTA 优化的模型泛化能力几乎与用标准方法训练的模型一样好。此外,尽管 DAWNBench 参赛作品能在 3 分钟内训练 ImageNet 模型,我们发现它们仍未能充分利用 Tensor Cores 等硬件能力。此外,我们发现分布式参赛作品可将一半以上时间花费在通信上。我们在 MLPERF v0.5 基准的参赛作品上展示了类似发现。
引用
@article{arxiv.1806.01427,
title = {Analysis of DAWNBench, a Time-to-Accuracy Machine Learning Performance Benchmark},
author = {Cody Coleman and Daniel Kang and Deepak Narayanan and Luigi Nardi and Tian Zhao and Jian Zhang and Peter Bailis and Kunle Olukotun and Chris Re and Matei Zaharia},
journal= {arXiv preprint arXiv:1806.01427},
year = {2019}
}