中文

用于随机块模型社区数估计的多假设检验

统计方法学 2026-02-17 v2 统计理论 统计理论

摘要

单细胞RNA测序(scRNA-seq)数据集的聚类可提供对细胞生物学功能的关键见解。因此,网络基方法(一种较好的聚类方法)正日益被用于scRNA-seq数据集的聚类。实施网络基方法的主要挑战在于,这些方法\emph{事先}需要社区或块的真实数量才能估计社区成员。虽然已有方法可估计社区的数量,但不适用于噪声较大的scRNA-seq数据集。此外,我们需要从scRNA-seq数据集中提取合适网络的方法。为解决这些问题,我们提出了两个层面的解决方案:i) 一种从scRNA-seq数据集中提取随机块模型(SBM)的简单似然方法;ii) 一种用于估计SBM中社区数的新型顺序多假设检验(SMT)方法。我们研究了SMT的理论性质,在中等稀疏条件下建立其一致性。此外,我们比较了SMT与几种现有方法的数值性能。我们还展示了该方法在基准scRNA-seq数据集上对社区数的估计表现与现有方法相称。最后,我们使用该方法对人类视网膜偶锥细胞数据集的子群进行估计。

关键词

引用

@article{arxiv.2507.15471,
  title  = {Multiple Hypothesis Testing To Estimate The Number Of Communities in Stochastic Block Models},
  author = {Chetkar Jha and Mingyao Li and Ian Barnett},
  journal= {arXiv preprint arXiv:2507.15471},
  year   = {2026}
}

备注

This article is significantly improved version of the previous arXiv submission arXiv:2201.04722