面向单细胞表达数据分析的概率计数矩阵分解
统计方法学
2021-04-10 v5
摘要
高通量单细胞测序技术的发展使得研究细胞转录组的群体水平多样性成为可能。这种多样性表现出两个方面。首先,由于对低表达基因的测量,基因间表达动态(基因到基因的可变性)能够被更准确地量化。其次,细胞间可变性很高,仅有低比例的细胞在同一时间/水平表达同一基因。从统计学角度看,这些新兴模式极具挑战性,尤其是要对单细胞表达数据进行表示并给出概括性视图。PCA 是提供高维数据集合适表示的最有力框架之一,它通过寻找捕获数据中最大可变性的潜在方向来实现。遗憾的是,经典 PCA 基于欧氏距离和投影,在存在过离散计数并出现丢失事件(零膨胀)如单细胞表达数据的情况下表现不佳。我们提出一种用于单细胞表达数据分析的概率计数矩阵分解(pCMF)方法,该方法依赖于稀疏 Gamma-Poisson 因子模型。该层次模型使用变分 EM 算法进行推断,能够联合构建细胞和基因的低维表示。我们展示了这一概率框架如何诱导出一种适用于单细胞数据可视化的几何结构,并产生一种对聚类目的极为有效的数据压缩。我们的方法与其他标准表示方法(如 t-SNE)进行了比较,并展示了其在单细胞数据表示上的性能。我们特别关注公开可用的单细胞 RNA-seq 数据集。
引用
@article{arxiv.1710.11028,
title = {Probabilistic Count Matrix Factorization for Single Cell Expression Data Analysis},
author = {Ghislain Durif and Laurent Modolo and Jeff E. Mold and Sophie Lambert-Lacroix and Franck Picard},
journal= {arXiv preprint arXiv:1710.11028},
year = {2021}
}
备注
22 pages, 5 figures, 1 table, Appendix 19 pages, 13 figures