深度学习负载下 NVIDIA GPU 并发机制的特性分析
分布式、并行与集群计算
2021-10-04 v1 硬件体系结构
机器学习
摘要
我们研究了 NVIDIA 新 Ampere GPU 微架构在深度学习训练与推理负载下可用并发机制的性能。与以往将 GPU 视为黑盒的研究不同,我们从微架构层面考察调度。我们发现,缺乏细粒度抢占机制、鲁棒的任务优先级选项以及感知争用的线程块放置策略,限制了 NVIDIA 并发机制的有效性。总之,深度学习负载的序列性及其波动的资源需求与核函数运行时间,使得在当前 NVIDIA 硬件上执行此类负载的同时保持持续高利用率与低且可预测的周转时间十分困难。
引用
@article{arxiv.2110.00459,
title = {Characterizing Concurrency Mechanisms for NVIDIA GPUs under Deep Learning Workloads},
author = {Guin Gilman and Robert J. Walls},
journal= {arXiv preprint arXiv:2110.00459},
year = {2021}
}
备注
To Appear in the 39th International Symposium on Computer Performance, Modeling, Measurements and Evaluation (Performance 21)