基于CUDA的快速GPGPU数据重排内核
分布式、并行与集群计算
2010-11-17 v1 图形学
性能
摘要
许多高性能计算算法受限于带宽,因此需要最优的数据重排内核以及将其轻松集成到应用程序其余部分的方法。在这项工作中,我们构建了一个CUDA库,其中包含一组用于数据重排操作的快速内核。具体而言,我们构建了用于将m维数据重排为n维的通用内核,包括置换、重排序、交织/解交织等。我们还使用模板和仿函数构建了用于二维数据上通用模板计算的通用内核,使应用程序开发人员能够快速构建定制的高性能内核。所有构建的内核在带宽利用率方面均达到或超越了已知最佳性能。
引用
@article{arxiv.1011.3583,
title = {Fast GPGPU Data Rearrangement Kernels using CUDA},
author = {Michael Bader and Hans-Joachim Bungartz and Dheevatsa Mudigere and Srihari Narasimhan and Babu Narayanan},
journal= {arXiv preprint arXiv:1011.3583},
year = {2010}
}