中文

英伟达 GPU 谱系基准测试:从早期 K80 到支持异步内存传输的现代 A100

分布式、并行与集群计算 2021-07-06 v2

摘要

对许多人而言,图形处理单元(GPU)提供了可靠的计算能力来源。近来,英伟达推出了其第 9 代 HPC 级 GPU——Ampere 100(A100),声称相较前代有显著的性能提升,尤其在 AI 工作负载方面,并引入了诸如异步数据移动等新架构特性。但 A100 在非 AI 基准测试上表现如何,我们能否期待 A100 带来如同前几代 GPU 那样已习以为常的应用性能提升?本文中,我们对 A100 GPU 进行基准测试,并将其与四代前代 GPU 比较,重点在于经验性地量化我们所推导的性能预期,以及——若这些预期未达成——探究所引入的数据移动特性能否弥补任何潜在的性能损失?我们发现,对于知名的 Rodinia 基准测试套件,A100 带来的性能提升小于前几代;我们展示了其中部分性能异常可通过巧妙运用新的数据移动特性来补救,我们对其进行了微基准测试,并展示了应在何处(更重要的是如何)使用这些特性。

关键词

引用

@article{arxiv.2106.04979,
  title  = {Benchmarking the Nvidia GPU Lineage: From Early K80 to Modern A100 with Asynchronous Memory Transfers},
  author = {Martin Svedin and Steven W. D. Chien and Gibson Chikafa and Niclas Jansson and Artur Podobas},
  journal= {arXiv preprint arXiv:2106.04979},
  year   = {2021}
}

备注

7 pages