超图模体:概念、算法与发现
社会与信息网络
2020-07-21 v2 数据库
数据结构与算法
摘要
超图自然地表示群体交互,这类交互普遍存在于诸多领域:研究者的合作、商品的共同购买、蛋白质的共同作用等。本工作中,我们提出工具以系统性地回答以下问题:(Q1)真实世界超图的结构设计原则是什么?(Q2)我们如何比较不同规模超图的局部结构?(Q3)我们如何识别超图所源自的领域?我们首先定义超图模体(h-motifs),其描述三个相连超边的连通模式。然后,我们将超图中各h-motif的显著性定义为其出现次数相对于适当随机化超图中的出现次数。最后,我们将特征轮廓(CP)定义为每个h-motif归一化显著性的向量。关于Q1,我们发现来自5个领域的11个真实世界超图中h-motifs的出现明显区别于随机化超图。此外,我们证明CP能捕捉各领域独有的局部结构模式,因此比较超图的CP可解决Q2与Q3。我们的算法贡献是提出MoCHy,一个用于计数超图中h-motifs出现次数的并行算法族。我们从理论上分析其速度与精度,并经验性地表明先进近似版本MoCHy-A+分别比基础近似与精确版本最高精确25倍、快32倍。
引用
@article{arxiv.2003.01853,
title = {Hypergraph Motifs: Concepts, Algorithms, and Discoveries},
author = {Geon Lee and Jihoon Ko and Kijung Shin},
journal= {arXiv preprint arXiv:2003.01853},
year = {2020}
}
备注
to be published in the 46th International Conference on Very Large Data Bases (VLDB '20)