中文

图与度量空间中通过加权采样的平均距离查询:高可扩展性与严格统计保证

社会与信息网络 2015-06-29 v6 机器学习

摘要

图中一个节点到所有其他节点的平均距离,或度量空间中一个查询点到一组点的平均距离,是数据分析中的基本量。平均距离的倒数,即节点的(经典)紧密中心性(closeness centrality),是社会网络研究中的一种常用重要性度量。我们基于加权采样对距离关系的可稀疏性提出了新颖的结构性见解。基于此,我们提出了具有强统计保证的实用算法来解决基本问题。我们证明,图中所有节点的平均距离(以及其中心性)可以使用 O(ϵ2)O(\epsilon^{-2}) 次单源距离计算来估计。对于度量空间中的 nn 个点构成的集合 VV,我们证明在经过使用 O(n)O(n) 次距离计算的前处理后,我们可以计算大小为 O(ϵ2)O(\epsilon^{-2}) 的加权样本 SVS\subset V,使得从任意查询点 vvVV 的平均距离可以通过 vvSS 的距离来估计。最后,我们证明对于度量空间中的点集 VV,我们可以使用 O(n+ϵ2)O(n+\epsilon^{-2}) 次距离计算来估计平均成对距离。该估计基于 O(ϵ2)O(\epsilon^{-2}) 对点的加权样本,该样本使用 O(n)O(n) 次距离计算求得。我们的估计是无偏的,归一化均方误差(NRMSE)至多为 ϵ\epsilon。将样本量增大 O(logn)O(\log n) 倍可确保相对误差超过 ϵ\epsilon 的概率呈多项式级小。

关键词

引用

@article{arxiv.1503.08528,
  title  = {Average Distance Queries through Weighted Samples in Graphs and Metric Spaces: High Scalability with Tight Statistical Guarantees},
  author = {Shiri Chechik and Edith Cohen and Haim Kaplan},
  journal= {arXiv preprint arXiv:1503.08528},
  year   = {2015}
}

备注

21 pages, will appear in the Proceedings of RANDOM 2015