基因调控网络推断何时会失败?关于单细胞数据的因果与相关方法的受控诊断研究
机器学习
2026-05-07 v1 人工智能
基因组学
定量方法
机器学习
摘要
尽管在理论上具有优势,但用于从单细胞 RNA-seq 数据推断基因调控网络 (GRN) 的因果方法在许多现实基准测试中始终未能匹配或超越基于相关性的基线方法,这一持续的谜团动摇了因果性对此任务的价值。我们认为现有基准测试控制性不足,无法回答此问题,因为它们在真实或半真实数据上进行评估,存在多种病理情况共存,混淆了失效模式,掩盖了不同推断方法在何处优势或失败的具体条件。为弥合这一差距,我们引入了一个受控诊断框架,用于隔离七种生物学激发的病理情况(dropout、潜在混杂因子、细胞类型混合、反馈环路、网络密度、样本量和伪时间漂移),并衡量六种代表性方法在每种病理情况加剧时的性能衰减。通过 6,120 项受控实验,我们发现因果方法在干净且结构上有利的情境下确实占据优势,但特定病理情况(尤其是 dropout 和潜在混杂因子)会选择性中和它们的优势。我们进一步引入一种误差类型分解,揭示具有相似整体准确性的方法会提交不同类型的错误。为探讨单病理情况的效应是否在多种应激共存时仍然成立,我们对三种最具影响力的病理情况进行相互作用扫查,发现它们的联合效应是亚相加的,同时也暴露出密度条件下的跨越,此类现象在单拨轮分析中难以察觉。我们的发现提供了对不同方法在 GRN 推断中何时为何成功或失败的细致理解,为方法开发提供可操作的见解,并为实践者提供实际指导。
引用
@article{arxiv.2605.04930,
title = {When Does Gene Regulatory Network Inference Break? A Controlled Diagnostic Study of Causal and Correlational Methods on Single-Cell Data},
author = {Miguel Fernandez-de-Retana and Ruben Sanchez-Corcuera and Unai Zulaika and Aritz Bilbao-Jayo and Aitor Almeida},
journal= {arXiv preprint arXiv:2605.04930},
year = {2026}
}
备注
19 pages, 10 figures