中文

通过微基准测试剖析英伟达图灵T4 GPU

分布式、并行与集群计算 2019-03-19 v1

摘要

2019年,GPU制造商刷新其设计的高速节奏,加上他们不愿披露微体系结构细节,对于希望榨取最高可能性能的软件设计者而言仍是一大障碍。去年,正是这些原因促使我们使用微基准测试来剖析Volta GPU架构。2018年8月图灵(NVidia最新架构)的推出促使我们更新研究。在本报告中,我们考察图灵并与前几代NVidia GPU进行定量比较。具体而言,我们研究T4 GPU:一款面向推理应用的低功耗板卡。我们描述了其相对于面向推理的前身(基于Pascal架构的P4 GPU)的改进。T4和P4 GPU均比其全尺寸对应产品实现了显著更高的每瓦频率指标。我们研究T4的TensorCores性能,发现其对低精度操作数的吞吐量远高于P4 GPU。我们揭示图灵引入了能更简洁表达矩阵数学的新指令。我们映射图灵的指令空间,发现其与Volta相同的编码以及附加指令。我们揭示图灵TU104芯片具有与Volta GV100相同的存储器层次深度;TU104上的缓存级别大小通常是Pascal GP104上对应大小的两倍。我们对T4存储器层次的每个组成部分进行基准测试,发现相较其P4前身有实质性的整体性能提升。我们研究了时钟节流如何影响达到功耗或热极限的计算密集型工作负载。我们的许多发现是新颖的,在此首次发表。所有这些都能指导高性能软件开发者更接近GPU的峰值性能。

关键词

引用

@article{arxiv.1903.07486,
  title  = {Dissecting the NVidia Turing T4 GPU via Microbenchmarking},
  author = {Zhe Jia and Marco Maggioni and Jeffrey Smith and Daniele Paolo Scarpazza},
  journal= {arXiv preprint arXiv:1903.07486},
  year   = {2019}
}

备注

65 pages