图与度量空间中通过加权采样的平均距离查询:高可扩展性与严格统计保证
社会与信息网络
2015-06-29 v6 机器学习
摘要
图中一个节点到所有其他节点的平均距离,或度量空间中一个查询点到一组点的平均距离,是数据分析中的基本量。平均距离的倒数,即节点的(经典)紧密中心性(closeness centrality),是社会网络研究中的一种常用重要性度量。我们基于加权采样对距离关系的可稀疏性提出了新颖的结构性见解。基于此,我们提出了具有强统计保证的实用算法来解决基本问题。我们证明,图中所有节点的平均距离(以及其中心性)可以使用 次单源距离计算来估计。对于度量空间中的 个点构成的集合 ,我们证明在经过使用 次距离计算的前处理后,我们可以计算大小为 的加权样本 ,使得从任意查询点 到 的平均距离可以通过 到 的距离来估计。最后,我们证明对于度量空间中的点集 ,我们可以使用 次距离计算来估计平均成对距离。该估计基于 对点的加权样本,该样本使用 次距离计算求得。我们的估计是无偏的,归一化均方误差(NRMSE)至多为 。将样本量增大 倍可确保相对误差超过 的概率呈多项式级小。
引用
@article{arxiv.1503.08528,
title = {Average Distance Queries through Weighted Samples in Graphs and Metric Spaces: High Scalability with Tight Statistical Guarantees},
author = {Shiri Chechik and Edith Cohen and Haim Kaplan},
journal= {arXiv preprint arXiv:1503.08528},
year = {2015}
}
备注
21 pages, will appear in the Proceedings of RANDOM 2015