中文

学习细胞响应的可识别因子化因果表征

机器学习 2024-12-04 v3 定量方法

摘要

对细胞及其对遗传或化学扰动响应的研究有望加速治疗靶点的发现。然而,为此类数据设计充分且富有洞察力的模型是困难的,因为细胞对扰动的响应本质上取决于其生物学背景(例如,遗传背景或细胞类型)。例如,在发现治疗靶点时,人们可能希望富集那些特异性靶向某种细胞类型的药物。这一挑战强调了需要能够明确考虑药物与背景之间潜在相互作用的方法。为了实现这一目标,我们提出了一种新颖的因子化因果表征(FCR)学习方法,该方法揭示了来自多个细胞系的单细胞扰动数据中的因果结构。基于可识别深度生成模型的框架,FCR 学习多个解耦的细胞表征,这些表征由协变量特异性(zx\mathbf{z}_x)、处理特异性(zt\mathbf{z}_{t})和交互特异性(ztx\mathbf{z}_{tx})模块组成。基于非线性 ICA 理论的最新进展,我们证明了 ztx\mathbf{z}_{tx} 的逐分量可识别性以及 zt\mathbf{z}_tzx\mathbf{z}_x 的逐块可识别性。然后,我们展示了 FCR 的实现,并通过实验证明,在四个单细胞数据集的各种任务中,它优于最先进的基线方法。

关键词

引用

@article{arxiv.2410.22472,
  title  = {Learning Identifiable Factorized Causal Representations of Cellular Responses},
  author = {Haiyi Mao and Romain Lopez and Kai Liu and Jan-Christian Hütter and David Richmond and Panayiotis V. Benos and Lin Qiu},
  journal= {arXiv preprint arXiv:2410.22472},
  year   = {2024}
}