中文

拉取式图处理的新前沿

分布式、并行与集群计算 2019-03-20 v1

摘要

拉取式与推送式图处理引擎之间的权衡已被充分理解。一方面,拉取式引擎可实现更高吞吐量,因为其工作负载以读为主而非以写为主,且无需线程间同步即可进行。另一方面,推送式引擎能更好地利用前沿优化,该优化利用的事实是:通常仅需访问图的一小部分即可完成图处理应用的一次迭代。混合引擎试图通过动态切换推送与拉取来克服此权衡,但该方法有两个关键缺点。首先,应用必须实现两次(一次推送、一次拉取);其次,以推送方式运行的迭代会降低处理吞吐量。我们提出一种截然不同的方案:彻底重构前沿优化,使其适配拉取式引擎。如此一来,我们消除了推送式引擎相对于拉取式引擎的唯一优势,从而可完全弃用推送式引擎。我们引入 Wedge,一种仅拉取的图处理框架,它将传统的面向源的基于顶点的前沿转换为称为 Wedge 前沿的拉取友好格式。即便并行化,该转换本身开销也很大,因此我们引入两项关键优化使其实用。首先,仅当生成的 Wedge 前沿足够稀疏时才执行转换。其次,我们粗化 Wedge 前沿中元素表示的粒度。这些优化分别将 Wedge 性能提升至多 5 倍和 2 倍,使其分别优于 Grazelle、Ligra 和 GraphMat 至多 2.8 倍、4.9 倍和 185.5 倍。

关键词

引用

@article{arxiv.1903.07754,
  title  = {A New Frontier for Pull-Based Graph Processing},
  author = {Samuel Grossman and Christos Kozyrakis},
  journal= {arXiv preprint arXiv:1903.07754},
  year   = {2019}
}