中文

单细胞测序数据中的准普适性

定量方法 2018-10-11 v1 统计力学 概率论 应用物理 数据分析、统计与概率

摘要

单细胞技术的发展提供了识别新细胞状态并重构新颖细胞间关系的机会。其应用范围从理解后生动物发育中的转录与表观遗传过程,到表征异质群体(如癌症或免疫细胞)中的不同细胞类型。然而,数据分析受其未知的内在生物与技术变异性以及稀疏性的阻碍;这些因素使在伪影与噪声中识别真实生物信号变得复杂。此处我们表明,跨技术而言,各单细胞数据集导出的约95%的特征值可由随机矩阵理论预测的普适分布描述。有趣的是,5%的谱偏离这些分布并呈现称为特征向量局域化的现象,其中信息紧密集中于细胞群中。部分局域化特征向量反映潜在生物信号,部分仅为单细胞数据稀疏性的后果;约3%为伪影。基于普适分布与一种检测稀疏性诱导局域化的技术,我们提出一种策略以识别编码生物信息的残余2%方向,从而去除单细胞数据噪声。我们通过在具显著细胞群体的多个实例中与标准单细胞数据分析技术比较,展示了该方法的有效性。

关键词

引用

@article{arxiv.1810.03602,
  title  = {Quasi-universality in single-cell sequencing data},
  author = {Luis Aparicio and Mykola Bordyuh and Andrew J. Blumberg and Raul Rabadan},
  journal= {arXiv preprint arXiv:1810.03602},
  year   = {2018}
}

备注

Main text has 18 pages and 5 figures. Supplementary material (methods) has 21 pages and 16 figures