中文

ULV:一种用于聚类数据的鲁棒统计方法及其在多主体单细胞组学数据中的应用

统计方法学 2024-06-12 v1 定量方法 统计计算

摘要

分子和基因组技术的进步极大地增强了我们对生物过程的理解,使我们能够对关键生物变量(如基因表达、蛋白水平和微生物组成分)进行量化。这些突破使我们能够实现对测量的日益提高的分辨率,体现在我们能够对生物信息进行单细胞水平的全面轮廓化。然而,这类数据的分析面临诸多关键挑战:个体数量有限、数据非正态、可能存在漏掉值、异常值以及来自同一个体的重复测量。本文提出了一种新方法,称为基于U统计量的潜变量(ULV)。我们提出的方法利用了基于秩的统计量的鲁棒性,并针对小样本量发挥参数方法的统计效率。它是一种在计算上是可行的框架,能够同时解决上述所有问题。ULV的一个额外优势是其在对各种类型的单细胞数据进行建模时的灵活性,包括RNA和蛋白质丰度。我们的方法在两个研究中展示了其有用性:一个关于急性髓性白血病(AML)的单细胞蛋白质组学研究,以及一个关于新冠病毒症状的单细胞RNA研究。在AML研究中,ULV成功地识别出了 pseudobulk 版本的 Wilcoxon 秩和检验将被忽略的差异表达蛋白。在新冠病毒研究中,ULV识别出与年龄和性别等协变量相关的基因,以及在不调整协变量的情况下将被忽略的基因。由我们的方法识别的差异表达基因对高表达水平基因的偏倚较小。此外,ULV还识别出可能与新冠病毒重症机制有关的额外基因通路。

关键词

引用

@article{arxiv.2406.06767,
  title  = {ULV: A robust statistical method for clustered data, with applications to multisubject, single-cell omics data},
  author = {Mingyu Du and Kevin Johnston and Veronica Berrocal and Wei Li and Xiangmin Xu and Zhaoxia Yu},
  journal= {arXiv preprint arXiv:2406.06767},
  year   = {2024}
}