中文

利用辅助warp加速GPU执行中瓶颈的框架

硬件体系结构 2016-02-04 v1

摘要

现代图形处理单元(GPU)充分支持数千线程的并发执行。不幸的是,执行期间的不同瓶颈和异构应用需求导致核心内资源利用的不平衡。例如,当GPU受限于可用的片外内存带宽时,其计算资源常常大量空闲,等待来自内存的数据到达。本工作描述了核心辅助瓶颈加速(CABA)框架,该框架利用空闲的片上资源来缓解GPU执行中的不同瓶颈。CABA提供灵活机制自动生成“辅助warp(assist warps)”,在GPU核心上执行可改善GPU性能和效率的特定任务。CABA支持使用空闲计算单元和流水线来缓解内存带宽瓶颈,例如通过使用辅助warp执行数据压缩以减少从内存传输的数据量。反之,同一框架可用于处理GPU受限于可用计算单元的情况,此时内存流水线空闲且可被CABA用来加速计算,例如通过辅助warp执行记忆化(memoization)。我们提供了CABA的全面设计和评估,以在GPU内存层次结构中执行有效且灵活的数据压缩,从而缓解内存带宽瓶颈。我们广泛的评估表明,当CABA用于实现数据压缩时,在各种对内存带宽敏感的GPGPU应用上平均性能提升41.7%(最高达2.6X)。

关键词

引用

@article{arxiv.1602.01348,
  title  = {A Framework for Accelerating Bottlenecks in GPU Execution with Assist Warps},
  author = {Nandita Vijaykumar and Gennady Pekhimenko and Adwait Jog and Saugata Ghose and Abhishek Bhowmick and Rachata Ausavarangnirun and Chita Das and Mahmut Kandemir and Todd C. Mowry and Onur Mutlu},
  journal= {arXiv preprint arXiv:1602.01348},
  year   = {2016}
}