中文

双白化揭示计数矩阵的秩

统计理论 2023-07-12 v2 信息论 math.IT 统计理论

摘要

估计 corrupted 数据矩阵的秩是数据分析中的一项重要任务,最显著的是用于选择PCA中的分量数。利用随机矩阵理论刻画大噪声矩阵的谱性质,在该任务上取得了显著进展。然而,当数据矩阵由计数随机变量(例如泊松变量)组成时,利用此类工具并不简单,此时噪声可能是异方差的且每个条目具有未知方差。本文中,我们考虑具有独立条目的泊松随机矩阵,并提出一种称为双白化(biwhitening)的简单过程,用于在无任何先验知识的情况下估计底层信号矩阵(即泊松参数矩阵)的秩。我们的方法基于一个关键观察:可同时缩放数据矩阵的行和列,使得相应噪声的谱与标准Marchenko-Pastur (MP)律一致,从而证明使用MP上边缘作为秩选择的阈值是合理的。重要的是,所需缩放因子可通过Sinkhorn-Knopp算法求解矩阵缩放问题直接从观测值中估计。除泊松外,我们的方法还推广到满足均值与方差之间二次关系的分布族,如广义泊松、二项、负二项、伽马以及许多其他分布。该二次关系也可解释数据中的缺失条目。我们进行了数值实验佐证了我们的理论发现,并展示了我们的方法在困难区间中秩估计的优势。此外,我们在多个单细胞RNA测序(scRNA-seq)、高通量染色体构象捕获(Hi-C)和文档主题建模的真实数据集上展示了我们方法的良好性能。

关键词

引用

@article{arxiv.2103.13840,
  title  = {Biwhitening Reveals the Rank of a Count Matrix},
  author = {Boris Landa and Thomas T. C. K. Zhang and Yuval Kluger},
  journal= {arXiv preprint arXiv:2103.13840},
  year   = {2023}
}