中文

并发 GPU 核函数的功耗—性能表征的经验—统计方法

分布式、并行与集群计算 2020-11-06 v2 硬件体系结构 图形学

摘要

数据中心中节能型吞吐加速器(GPU)的部署日益增长,要求增强 GPU 的功耗—性能协同优化能力。利用加速器实现百亿亿次计算需要进一步改善功耗效率。随着加速器中内核并发执行的固化支持,工作负载间及工作负载内的同步核计算有望以更低能耗预算实现更高吞吐。为改进架构的每瓦性能(Performance-per-Watt)指标,需要对真实吞吐工作负载(含并发内核执行)进行系统性实证研究。为此,我们提出一个多核吞吐工作负载生成框架,将有助于百亿亿次数据中心的激进能耗与性能管理,并推动吞吐架构的协同功耗—性能优化。此外,我们基于该框架展示了一套多核吞吐基准测试套件,其封装了基于对称、非对称及共存(常同时出现)核的工作负载。平均而言,我们的分析表明,在 GTX470、Tesla M2050 与 Tesla K20 上,跨 12 个基准测试,吞吐架构中内核执行的空间与时间并发分别节省能耗 32%、26% 与 33%。并发与利用率提升常相关,但并不意味着功耗耗散的显著偏离。所提多核的多样性分析证实了套件内的特征差异与功耗剖面多样性。此外,我们阐释了关于并发吞吐工作负载功耗—性能协同优化的若干发现。

关键词

引用

@article{arxiv.2011.02368,
  title  = {An Empirical-cum-Statistical Approach to Power-Performance Characterization of Concurrent GPU Kernels},
  author = {Nilanjan Goswami and Amer Qouneh and Chao Li and Tao Li},
  journal= {arXiv preprint arXiv:2011.02368},
  year   = {2020}
}