中文

基于图采样的技术估算模体数量

统计理论 2018-02-23 v1 离散数学 机器学习 统计理论

摘要

应用研究者常从节点的随机样本中构建网络,以推断父网络的性质。两种最广泛使用的采样方案是子图采样(以概率 pp 独立采样每个顶点并观测由采样顶点诱导的子图)和邻域采样(额外观测采样顶点与其邻居之间的边)。本文从统计角度研究在两种模型下估计作为诱导子图的模体数量的问题。我们证明:对任意含 kk 个顶点的连通图 hh,要以乘性误差 ϵ\epsilon 估计 s=s(h,G)s=\mathsf{s}(h,G)(即最大度数为 dd 的父图 GGhh 的副本数),(a) 对于子图采样,最优采样比 ppΘk(max{(sϵ2)1k,  dk1sϵ2})\Theta_{k}(\max\{ (s\epsilon^2)^{-\frac{1}{k}}, \; \frac{d^{k-1}}{s\epsilon^{2}} \}),由 Horvitz-Thompson 型估计量实现。(b) 对于邻域采样,我们提出一族估计量,涵盖并优于 Horvitz-Thompson 估计量,达到采样比 Ok(min{(dsϵ2)1k1,  dk2sϵ2})O_{k}(\min\{ (\frac{d}{s\epsilon^2})^{\frac{1}{k-1}}, \; \sqrt{\frac{d^{k-2}}{s\epsilon^2}}\})。对至多 44 个顶点的所有模体及所有大小的团,该结果被证明是最优的。匹配的最小最大下界利用子图计数的某些代数性质建立。这些结果量化了邻域采样比子图采样信息量高出多少,并在合成与真实数据实验中得到实证验证。我们还处理了适应未知最大度数的问题,并研究了具有附加结构(如树或平面图)的父图上的具体问题。

关键词

引用

@article{arxiv.1802.07773,
  title  = {Counting Motifs with Graph Sampling},
  author = {Jason M. Klusowski and Yihong Wu},
  journal= {arXiv preprint arXiv:1802.07773},
  year   = {2018}
}