GPU 内核的自动水平融合
分布式、并行与集群计算
2020-07-03 v1 编程语言
摘要
我们提出自动水平融合,这是一种补充 GPU 程序标准内核融合技术的新型优化技术。与旨在消除中间数据往返的标准融合不同,我们的水平融合技术旨在提高线程级并行度以隐藏指令延迟。我们还提出了 HFuse,一个实现自动水平融合的新的源到源 CUDA 编译器。我们的实验结果表明,水平融合可将运行时间加速 2.5% 至 60.8%。我们的结果揭示,水平融合对于融合需要不同类型 GPU 资源的内核(例如,一个内存密集型内核和一个计算密集型内核)特别有益。
引用
@article{arxiv.2007.01277,
title = {Automatic Horizontal Fusion for GPU Kernels},
author = {Ao Li and Bojian Zheng and Gennady Pekhimenko and Fan Long},
journal= {arXiv preprint arXiv:2007.01277},
year = {2020}
}