中文

高性能SIMT中的动态线程束大小调整

硬件体系结构 2012-11-06 v2

摘要

现代GPU在每个指令处同步分组在warp中的线程。这提高了SIMD效率,并使得共享取指和解码资源成为可能。每个warp中包含的线程数(即warp大小)会影响分支分歧、同步开销和内存访问合并的效率。小warp减少了与分支和内存分歧相关的性能损失,但代价是内存合并的减少。大warp显著增强了内存合并,但也增加了分支和内存分歧。动态工作负载行为,包括分支/内存分歧和合并,是决定最佳性能的warp大小的重要因素。最佳warp大小可能因工作负载而异,或从一个程序阶段到下一个阶段而变化。基于这一观察,我们提出了动态warp大小调整(DWR)。DWR采用创新的微架构步骤,在运行时根据程序特性调整warp大小。与静态warp大小决策相比,DWR性能提升高达1.7倍至2.28倍,同时面积开销小于1%。我们研究了各种替代配置,并表明DWR在更窄的SIMD和更大的缓存上表现更好。

关键词

引用

@article{arxiv.1208.2374,
  title  = {Dynamic Warp Resizing in High-Performance SIMT},
  author = {Ahmad Lashgar and Amirali Baniasadi and Ahmad Khonsari},
  journal= {arXiv preprint arXiv:1208.2374},
  year   = {2012}
}

备注

9 pages, 5 Figures, 3 Lists, 1 Table, The extended version of ICCD 2012 poster paper