用稀疏加性机制偏移变分自编码器建模细胞扰动
机器学习
2024-01-17 v2 人工智能
机器学习
定量方法
摘要
近年来,干预下观测数据的生成模型一直是机器学习与科学界关注的热点。例如,在药物发现中,需要建模多样干预对细胞的影响,以刻画未知的生物作用机制。我们提出稀疏加性机制偏移变分自编码器 SAMS-VAE,将组合性、解耦性与可解释性结合于扰动模型。SAMS-VAE 将扰动样本的潜状态建模为捕获样本特定变化的局部潜变量与稀疏全局潜干预效应变量之和。关键在于,SAMS-VAE 对单个扰动的全局潜变量进行稀疏化,以识别可灵活组合的解耦的、扰动特定的潜子空间。我们在两项流行的单细胞测序数据集上从定量与定性两方面评估 SAMS-VAE。为度量扰动特定的模型性质,我们还引入了基于平均处理效应并与后验预测检验相关联的扰动模型评估框架。SAMS-VAE 在分布内与分布外任务(包括资源匮乏下的组合推理任务)的泛化上优于可比模型,并产生与已知生物机制强相关的可解释潜结构。我们的结果表明 SAMS-VAE 是机器学习驱动科学发现建模工具箱中有意义的补充。
引用
@article{arxiv.2311.02794,
title = {Modelling Cellular Perturbations with the Sparse Additive Mechanism Shift Variational Autoencoder},
author = {Michael Bereket and Theofanis Karaletsos},
journal= {arXiv preprint arXiv:2311.02794},
year = {2024}
}
备注
Presented at the 37th Conference on Neural Information Processing Systems (NeurIPS 2023) (Post-NeurIPS fixes: cosmetic fixes, updated references, added simulation to appendix)