Panther:大型网络中的快速 Top-k 相似性搜索
社会与信息网络
2015-04-14 v2
摘要
估计顶点间的相似性是跨社交网络和生物网络等多个领域网络分析中的一个基本问题。基于共同邻居和结构上下文的方法受到了广泛关注。然而,这两类方法都难以扩展以处理大型网络(拥有数十亿节点)。在本文中,我们提出了一种采样方法,该方法可证明性地且准确地估计顶点间的相似性。该算法基于一种新颖的随机路径思想,并提出了一种扩展方法,以增强两个完全断开连接的顶点间的结构相似性。我们为所提算法的误差界和置信度提供了理论证明。我们进行了广泛的实证研究,表明我们的算法在网络中为任意顶点获取 top-k 相似顶点的速度比最先进方法快约 300 倍。我们还利用身份解析和结构洞跨度寻找这两个社交网络中的重要应用,来评估估计相似性的准确性。实验结果表明,所提算法的性能明显优于几种替代方法。
引用
@article{arxiv.1504.02577,
title = {Panther: Fast Top-k Similarity Search in Large Networks},
author = {Jing Zhang and Jie Tang and Cong Ma and Hanghang Tong and Yu Jing and Juanzi Li},
journal= {arXiv preprint arXiv:1504.02577},
year = {2015}
}
备注
10 pages, 10 figures