scE2TM 提升单细胞嵌入可解释性并揭示细胞扰动签名
机器学习
2025-12-08 v3
摘要
单细胞 RNA 测序技术已彻底改变我们对细胞异质性的理解,但计算方法往往难以在性能与生物学可解释性之间取得平衡。嵌入式主题模型广泛用于可解释的单细胞嵌入学习。然而,这些模型可能存在解释性坍缩问题,即主题在语义上相互靠近,导致主题冗余且未能完整捕捉生物学变异。进一步,单细胞基础模型的出现为利用外部生物学知识指导模型嵌入提供了可能。本文提出 scE2TM,一个外部知识引导的嵌入式主题模型,为 scRNA-seq 分析提供高质量的细胞嵌入和解释。通过嵌入聚类正则化方法,每个主题被约束为单独聚合基因簇的中心,从而使其捕获独特的生物学信息。在 20 个 scRNA-seq 数据集上,scE2TM 在七个最先进方法中实现了优越的聚类性能。更全面的可解释性基准测试进一步显示,scE2TM 学习的主题在多样性和与底层生物学通路的一致性方面表现更佳。对干扰刺激的 PBMCs 进行建模,scE2TM 模拟主题扰动,使控制细胞趋向刺激样转录状态,忠实地反映实验干扰反应。在黑色素瘤中,scE2TM 识别恶性特异性主题并推导出其到未见的患者数据,揭示与患者生存相关的基因程序。
关键词
引用
@article{arxiv.2507.08355,
title = {scE2TM improves single-cell embedding interpretability and reveals cellular perturbation signatures},
author = {Hegang Chen and Yuyin Lu and Yifan Zhao and Zhiming Dai and Fu Lee Wang and Qing Li and Yanghui Rao and Yue Li},
journal= {arXiv preprint arXiv:2507.08355},
year = {2025}
}