将多轴高斯图谱模型扩展至百万细胞规模
机器学习
2026-03-18 v2 机器学习
基因组学
摘要
动机:网络 underpin (支撑) 许多生物数据集的生成和解释:基因网络阐明了基因组的调控结构,细胞网络可捕捉肿瘤微环境的结构。然而,大多数学习此类网络的方法都存在错误的'独立性假设';为了学习基因网络,它们假设不存在细胞网络。'多轴'方法不做这一假设,但无法扩展到数千个细胞或基因之外。这限制了其仅能应用于最小数据集的范围。结果:我们开发了一种能够在分钟内处理百万细胞数据的多轴方法。这之前是不可能的,解锁了在现代单细胞 RNA 测序数据集上以及更复杂数据集上使用此类方法的能力。我们展示了该方法从真实单细胞数据中获得新颖的生物学见解,并与现有的 hdWGCNA 方法进行了有竞争力的比较。特别是,它识别了可能在神经元发育中具有调控或功能作用的长非编码 RNA 基因。可用性与实施情况:我们的 методology 作为 Python 软件包 GmGM 可在 PyPI 上获取(https://pypi.org/project/GmGM/0.5.3/)。本文所做的所有实验的代码均可在 GitHub 上获取(https://github.com/BaileyAndrew/GmGM-Bioinformatics)。联系人:[email protected] 补充信息:我们的证明以及一些额外实验均可在补充材料中获取。
关键词
引用
@article{arxiv.2407.19892,
title = {Making Multi-Axis Gaussian Graphical Models Scalable to Millions of Cells},
author = {Bailey Andrew and Erica L. Harris and James A. Poulter and David R. Westhead and Luisa Cutillo},
journal= {arXiv preprint arXiv:2407.19892},
year = {2026}
}
备注
8 pages (35 with appendix+references), 8 figures, 10 tables