中文

社区数量的优化估计

统计方法学 2022-01-27 v2 统计理论 统计理论

摘要

在网络分析中,如何估计社区数量 KK 是一个基本问题。我们考虑一个宽泛的设置,允许严重的度异质性和大范围的稀疏度水平,并提出逐步拟合优度(StGoF)作为一种新方法。这是一个逐步算法,对于 m=1,2,m = 1, 2, \ldots,我们交替使用社区检测步骤和拟合优度(GoF)步骤。我们采用 SCORE \cite{SCORE} 进行社区检测,并提出一种新的 GoF 度量。我们证明在步骤 mm,对于所有 m<Km < K,该 GoF 度量依概率发散到 \infty,若 m=Km = K 则收敛到 N(0,1)N(0,1)。这给出了 KK 的一致估计。此外,我们发现了针对该问题定义信噪比(SNR)的正确方式,并证明若 SNR\goto0\mathrm{SNR} \goto 0KK 的一致估计不存在,而若 SNR\goto\mathrm{SNR} \goto \infty 则 StGoF 对 KK 是一致一致的。因此,StGoF 达到了最优相变。类似的逐步方法(例如 \cite{wang2017likelihood, ma2018determining})已知面临分析挑战。我们通过在 StGoF 中使用不同的逐步方案并推导出此前未有的尖锐结果来克服这些挑战。我们分析的关键在于证明 SCORE 具有{\it 非分裂性质(NSP)}。主要由于 Davis-Kahan sin(θ)\sin(\theta) 定理所决定的特征向量不可处理的旋转,NSP 的证明是非平凡的,需要我们所发展的新技术。

关键词

引用

@article{arxiv.2009.09177,
  title  = {Optimal Estimation of the Number of Communities},
  author = {Jiashun Jin and Zheng Tracy Ke and Shengming Luo and Minzhe Wang},
  journal= {arXiv preprint arXiv:2009.09177},
  year   = {2022}
}