中文

SLUGGER:大规模图的无损层次化摘要方法

数据库 2021-12-13 v1 社会与信息网络

摘要

给定一个大规模图,我们如何利用其层次结构来简洁而精确地摘要该图?通过利用该结构,我们能否比最先进的图摘要方法获得更好的压缩率?Web 的爆炸式增长加速了大型图(如在线社交网络和超链接网络)的出现。因此,图压缩变得越来越重要,以便在不产生昂贵网络或磁盘 I/O 的情况下处理此类大图。在众多方法中,图摘要(其本质是将相似节点合并为超级节点并简洁地描述其连通性)凭借若干优势脱颖而出。然而,我们注意到,由于其底层表示模型强制超级节点互不相交,它未能利用真实世界图中普遍存在的层次结构。在本文中,我们提出层次化图摘要模型,这是一种富有表达力的图表示模型,将 Navlakha 等人先前提出的模型作为特例包含在内。新模型通过层次化超级节点之间的正边和负边来表示无权图,其中每个超级节点可包含其他节点。然后,我们提出 Slugger,一种可扩展的启发式方法,用于在我们的新模型下简洁且精确地表示给定图。Slugger 贪心地合并节点为超级节点,同时维护并利用其层次结构,随后对该层次结构进行剪枝。Slugger 通过采样、近似和记忆化显著加速了这一过程。我们在 16 个真实世界图上的实验表明,Slugger 具有:(a) 有效性:比最先进的无损摘要方法产生多达 29.6% 更简洁的摘要;(b) 快速性:在数小时内摘要具有 8 亿条边的图;(c) 可扩展性:随输入图的边数线性扩展。

关键词

引用

@article{arxiv.2112.05374,
  title  = {SLUGGER: Lossless Hierarchical Summarization of Massive Graphs},
  author = {Kyuhan Lee and Jihoon Ko and Kijung Shin},
  journal= {arXiv preprint arXiv:2112.05374},
  year   = {2021}
}

备注

to be published in the 38th IEEE International Conference on Data Engineering (ICDE '22)