用于随机块模型社区数估计的多假设检验
统计方法学
2026-02-17 v2 统计理论
统计理论
摘要
单细胞RNA测序(scRNA-seq)数据集的聚类可提供对细胞生物学功能的关键见解。因此,网络基方法(一种较好的聚类方法)正日益被用于scRNA-seq数据集的聚类。实施网络基方法的主要挑战在于,这些方法\emph{事先}需要社区或块的真实数量才能估计社区成员。虽然已有方法可估计社区的数量,但不适用于噪声较大的scRNA-seq数据集。此外,我们需要从scRNA-seq数据集中提取合适网络的方法。为解决这些问题,我们提出了两个层面的解决方案:i) 一种从scRNA-seq数据集中提取随机块模型(SBM)的简单似然方法;ii) 一种用于估计SBM中社区数的新型顺序多假设检验(SMT)方法。我们研究了SMT的理论性质,在中等稀疏条件下建立其一致性。此外,我们比较了SMT与几种现有方法的数值性能。我们还展示了该方法在基准scRNA-seq数据集上对社区数的估计表现与现有方法相称。最后,我们使用该方法对人类视网膜偶锥细胞数据集的子群进行估计。
引用
@article{arxiv.2507.15471,
title = {Multiple Hypothesis Testing To Estimate The Number Of Communities in Stochastic Block Models},
author = {Chetkar Jha and Mingyao Li and Ian Barnett},
journal= {arXiv preprint arXiv:2507.15471},
year = {2026}
}
备注
This article is significantly improved version of the previous arXiv submission arXiv:2201.04722