中文

基于多重假设检验的稀疏随机块模型社区数估计

统计方法学 2022-01-14 v1

摘要

基于网络的聚类方法通常要求事先指定社区数量。此外,大多数现有的估计社区数量的方法假设社区数量固定且不随网络规模 nn 变化。少数假设社区数量随网络规模 nn 增加的方法仅在网络平均度 dd 至少以 O(n)O(n) 的速度增长(即稠密情形)或处于某一狭窄范围内时有效。这在大规模网络数据聚类中带来了挑战,特别是当网络平均度 dd 的增长慢于 O(n)O(n) 的速率时(即稀疏情形)。为解决该问题,我们提出了一种利用多重假设检验以及 Erdős Rényi 图谱性质的新序贯过程,用于估计稀疏随机块模型(SBMs)中的社区数量。我们证明了该方法在稀疏 SBMs 中对大范围的稀疏参数具有一致性。由此,我们发现该方法能够估计社区数 K(n)K^{(n)}_{\star},且 K(n)K^{(n)}_{\star} 可高达以 O(n(13γ)/(43γ))O(n^{(1 - 3\gamma)/(4 - 3\gamma)}) 的速率增长,其中 d=O(n1γ)d = O(n^{1 - \gamma})。此外,我们表明该方法可作为二叉树随机块模型中估计社区数的停止准则。我们在六个参考单细胞 RNA 测序数据集上将本方法与其它竞争方法的性能进行了基准比较。最后,我们通过数值模拟以及将其用于聚类真实单细胞 RNA 测序数据集来展示本方法的实用性。

关键词

引用

@article{arxiv.2201.04722,
  title  = {Multiple Hypothesis Testing To Estimate The Number of Communities in Sparse Stochastic Block Models},
  author = {Chetkar Jha and Mingyao Li and Ian Barnett},
  journal= {arXiv preprint arXiv:2201.04722},
  year   = {2022}
}