重排序 GPU 内核启动以实现高效并发执行
分布式、并行与集群计算
2015-11-26 v1 数据结构与算法
摘要
当代 GPU 允许小计算内核的并发执行,以防止 GPU 资源闲置。尽管独立内核间存在潜在的并发性,但向 GPU 发出内核的顺序将显著影响应用程序性能。因此,提出了一种推导合适内核启动顺序的技术,旨在减少总执行时间。实验结果表明,所提方法给出的解在所有可能的内核启动序列排列的设计空间中远高于第 90 百分位标记。
引用
@article{arxiv.1511.07983,
title = {Reordering GPU Kernel Launches to Enable Efficient Concurrent Execution},
author = {Teng Li and Vikram K. Narayana and Tarek El-Ghazawi},
journal= {arXiv preprint arXiv:1511.07983},
year = {2015}
}
备注
2 Pages