中文

HBMax:在多核架构上优化并行影响力最大化的内存效率

分布式、并行与集群计算 2022-08-05 v2

摘要

影响力最大化旨在网络中选取 k 个最具影响力的顶点或种子,其中影响力由给定的扩散过程定义。尽管计算最优种子集是 NP-Hard,但存在高效的近似算法。然而,即便最先进的并行实现也受限于产生巨大内存占用的采样步骤。这进而限制了可处理的问题规模与近似质量。本文中,我们研究了在大型真实社交网络上 IMM(Influence Maximization via Martingales,基于鞅的影响力最大化)算法中收集反向可达性信息的采样过程的内存占用。我们提出了一种基于 Ripples(一种最先进的多线程并行影响力最大化方案)的内存高效优化方法(称为 HBMax)。我们的方法 HBMax 利用算法收集的部分反向可达(RR)集来学习图的特征,随后使用霍夫曼编码或位图编码压缩中间反向可达信息,并在部分解码的数据上或直接于压缩数据上查询,以保留通过压缩获得的内存节省。考虑到 NUMA 架构,我们将方案扩展至 64 个 CPU 核,在不损失精度的情况下将内存占用降低至多 82.1%,平均加速 6.3%(编码开销被内存减少带来的性能提升抵消)。对于最大的测试图 Twitter7(含 14 亿条边),HBMax 实现了 5.9 倍压缩比和 2.2 倍加速。

关键词

引用

@article{arxiv.2208.00613,
  title  = {HBMax: Optimizing Memory Efficiency for Parallel Influence Maximization on Multicore Architectures},
  author = {Xinyu Chen and Marco Minutoli and Jiannan Tian and Mahantesh Halappanavar and Ananth Kalyanaraman and Dingwen Tao},
  journal= {arXiv preprint arXiv:2208.00613},
  year   = {2022}
}

备注

13 pages, 6 figures, 8 tables, accepted by PACT' 22