什么样的表征适合单细胞扰动预测?
机器学习
2026-05-20 v1
摘要
单细胞扰动建模是理解和预测细胞对基因扰动反应的基础问题。然而,现有方法(从因果表征学习到基础模型)往往难以应对一个被忽视的挑战:基因表达主要由扰动不变信息主导,而扰动特定信号本质上稀疏。结果,所学表征要么将不变信息与扰动特定信息交织,导致虚假且不可泛化的预测器,要么抑制扰动特定信号,使其对预测无效。为此,我们提出了 PerturbedVAE,一个旨在解决此信号不平衡的通用框架。该框架显式地将扰动特定信息从占主导地位的不变结构中分离,并恢复因果表征,以有效利用此类信息进行预测。我们进一步提供了可辨识性分析,阐明稀疏扰动效应在何种条件下可被可靠恢复,从而阐明该框架在此类条件下如何具体指定。经验上,PerturbedVAE 在广泛使用的基准测试上实现了最先进的性能,在多种评估设置下均取得显著提升,尤其在超出分布的组合预测中取得显著 gains,并揭示了可解释的扰动-响应程序。
关键词
引用
@article{arxiv.2605.19343,
title = {What Makes a Representation Good for Single-Cell Perturbation Prediction?},
author = {Wenkang Jiang and Yuhang Liu and Yichao Cai and Erdun Gao and Jiayi Dong and Ehsan Abbasnejad and Lina Yao and Javen Qinfeng Shi},
journal= {arXiv preprint arXiv:2605.19343},
year = {2026}
}
备注
Accepted to ICML 2026