中文

面向 GPU 图分析的相干性、一致性与推/拉专用化

分布式、并行与集群计算 2020-02-26 v2

摘要

本工作首次研究了在具有原生统一共享内存的新兴集成 GPU-CPU 系统上,图工作负载中带细粒度同步与不带细粒度同步的更新传播(推 vs. 拉)、新兴相干协议(GPU vs. DeNovo 相干)以及以软件为中心的一致性模型(DRF0、DRF1 和 DRFrlx)之间的相互作用。我们研究了 6 个图应用与 6 个图输入,共 36 个工作负载,运行于反映上述更新传播、相干性和内存一致性设计空间的 12 种系统(硬件+软件)配置上。我们做出了三项关键贡献。首先,我们表明对于所有工作负载不存在单一最佳系统配置,从而推动了具有灵活相干性和一致性支持的系统的发展。其次,我们开发了一个模型来准确预测最佳系统配置——该模型可被软件设计者用于决定推 vs. 拉和一致性模型,也可被灵活硬件用于为给定工作负载调用适当的相干性和一致性配置。第三,我们表明此处探索的设计维度是相互依赖的,强化了在上述设计维度中软硬件协同设计的必要性。例如,决定推 vs. 拉的软件设计者必须考虑硬件所支持的一致性模型——在某些情况下,若硬件支持 DRFrlx 则推可能更优,而若硬件不支持 DRFrlx 则拉可能更优。

关键词

引用

@article{arxiv.2002.10245,
  title  = {Specializing Coherence, Consistency, and Push/Pull for GPU Graph Analytics},
  author = {Giordano Salvador and Wesley H. Darvin and Muhammad Huzaifa and Johnathan Alsop and Matthew D. Sinclair and Sarita V. Adve},
  journal= {arXiv preprint arXiv:2002.10245},
  year   = {2020}
}