批大小对图形与张量处理单元在训练与推理阶段性能的影响
机器学习
2019-04-04 v1 性能
机器学习
摘要
本文研究了为获得更优运行时间所能取的最大可能批大小对图形处理单元(GPU)与张量处理单元(TPU)在训练和推理阶段性能的影响。我们在标准MNIST与Fashion-MNIST数据集上对所选深度神经网络(DNN)进行了大量运行实验。与相当强大的GPU NVIDIA Tesla K80卡相比,即便仅使用极小规模的Google TPUv2单元(仅8核)也获得了显著加速:训练阶段加速最高达10倍(不计开销),预测阶段加速最高达2倍(计与不计开销均如此)。精确的加速值取决于TPUv2单元的利用率水平,并随处理数据量的增大而提高;但对于本工作所用数据集(图像尺寸28x28的MNIST与Fashion-MNIST),训练阶段批大小>512幅图像、预测阶段批大小>40 000幅图像时观察到加速。需注意,这些结果未损害预测精度与损失:在MNIST数据集上GPU与TPU运行的预测精度与损失均一致至第3位有效数字,在Fashion-MNIST数据集上一致至第2位有效数字。
引用
@article{arxiv.1812.11731,
title = {Batch Size Influence on Performance of Graphic and Tensor Processing Units during Training and Inference Phases},
author = {Yuriy Kochura and Yuri Gordienko and Vlad Taran and Nikita Gordienko and Alexandr Rokovyi and Oleg Alienin and Sergii Stirenko},
journal= {arXiv preprint arXiv:1812.11731},
year = {2019}
}
备注
10 pages, 7 figures, 2 tables