建模用于未见基因扰动的基因表达分布性变化
基因组学
2025-07-08 v1 机器学习
摘要
我们训练一个神经网络来预测基因表达在遗传扰动后发生分布性变化。这一任务在早期药物发现中至关重要,因此类响应可提供对基因功能的见解并可为靶点识别提供信息。现有方法仅预测表达水平的变化,忽略了单细胞数据中固有的随机性。相比之下,我们提供了更真实的细胞响应视图,通过建模表达分布来实现。我们的模型在条件于扰动的情况下预测基因级别的直方图,并在捕捉方差、偏度和峰度等更高阶统计量方面优于基线方法,同时训练成本更低。为实现对未见扰动的泛化,我们通过来自大型语言模型(LLM)的基因嵌入来整合先验知识。尽管构建更丰富的输出空间,该方法在预测均值表达变化方面仍然具有竞争力。这项工作为更具表达性和生物学信息性的扰动效应模型提供了实用性的步骤。
引用
@article{arxiv.2507.02980,
title = {Modeling Gene Expression Distributional Shifts for Unseen Genetic Perturbations},
author = {Kalyan Ramakrishnan and Jonathan G. Hedley and Sisi Qu and Puneet K. Dokania and Philip H. S. Torr and Cesar A. Prada-Medina and Julien Fauqueur and Kaspar Martens},
journal= {arXiv preprint arXiv:2507.02980},
year = {2025}
}