中文

用可扩展 GPLVM 建模 scRNA-seq 数据中的技术与生物效应

机器学习 2022-11-08 v2 基因组学 应用统计 机器学习

摘要

单细胞 RNA-seq 数据集在规模与复杂度上不断增长,使得在各种生物/临床背景下研究细胞组成变化成为可能。亟需可扩展的降维技术以解离其中的生物变异,同时考量技术与生物混杂因素。本工作中,我们扩展了用于概率非线性降维的流行方法——高斯过程潜变量模型,使其可扩展到海量单细胞数据集,同时显式考量技术与生物混杂因素。核心思想是使用一种增广核,其保持下界的可分解性,从而实现快速随机变分推断。我们展示了其以 9 倍更短训练时间重建 Kumasaka 等人(2021)所得先天免疫潜特征的能力。我们进一步分析了一个 COVID 数据集,并在 130 人的队列中证明该框架可实现数据整合,同时捕获可解释的感染特征。具体而言,我们将 COVID 严重程度作为潜维度以优化患者分层并捕获疾病特异性基因表达。

关键词

引用

@article{arxiv.2209.06716,
  title  = {Modelling Technical and Biological Effects in scRNA-seq data with Scalable GPLVMs},
  author = {Vidhi Lalchand and Aditya Ravuri and Emma Dann and Natsuhiko Kumasaka and Dinithi Sumanaweera and Rik G. H. Lindeboom and Shaista Madad and Sarah A. Teichmann and Neil D. Lawrence},
  journal= {arXiv preprint arXiv:2209.06716},
  year   = {2022}
}

备注

Machine Learning and Computational Biology Symposium (Oral), 2022