中文

什么样的表征适合单细胞扰动预测?

机器学习 2026-05-20 v1

摘要

单细胞扰动建模是理解和预测细胞对基因扰动反应的基础问题。然而,现有方法(从因果表征学习到基础模型)往往难以应对一个被忽视的挑战:基因表达主要由扰动不变信息主导,而扰动特定信号本质上稀疏。结果,所学表征要么将不变信息与扰动特定信息交织,导致虚假且不可泛化的预测器,要么抑制扰动特定信号,使其对预测无效。为此,我们提出了 PerturbedVAE,一个旨在解决此信号不平衡的通用框架。该框架显式地将扰动特定信息从占主导地位的不变结构中分离,并恢复因果表征,以有效利用此类信息进行预测。我们进一步提供了可辨识性分析,阐明稀疏扰动效应在何种条件下可被可靠恢复,从而阐明该框架在此类条件下如何具体指定。经验上,PerturbedVAE 在广泛使用的基准测试上实现了最先进的性能,在多种评估设置下均取得显著提升,尤其在超出分布的组合预测中取得显著 gains,并揭示了可解释的扰动-响应程序。

关键词

引用

@article{arxiv.2605.19343,
  title  = {What Makes a Representation Good for Single-Cell Perturbation Prediction?},
  author = {Wenkang Jiang and Yuhang Liu and Yichao Cai and Erdun Gao and Jiayi Dong and Ehsan Abbasnejad and Lina Yao and Javen Qinfeng Shi},
  journal= {arXiv preprint arXiv:2605.19343},
  year   = {2026}
}

备注

Accepted to ICML 2026