TwinPurify:通过自监督学习纯化基因表达数据以揭示肿瘤内在转录程序
机器学习
2026-01-28 v2 分子网络
摘要
单细胞与空间转录组技术的进步在细胞分辨率上改变了肿瘤生态系统分析。然而,针对患者队列的大规模研究仍依赖于大量转录组数据,其中肿瘤纯度的变化掩盖了肿瘤内在转录信号并限制了下游发现。许多解卷积方法在合成的大量混合物上表现出良好的性能,但由于未建模的生物学和技术变异,无法推广到真实的患者队列。在此,我们介绍了 TwinPurify,这是一个采用了 Barlow Twins 自监督目标的表示学习框架,标志着与解卷积范式的根本背离。TwinPurify 并非将大量混合物分解为离散的细胞类型比例,而是通过利用同一队列中相邻正常组织谱作为“背景”指导来学习连续、高维的肿瘤嵌入,从而能够在不依赖任何外部参考的情况下解耦肿瘤特异性信号。在跨越 RNA-seq 和微阵列平台的多个大型癌症队列基准测试中,TwinPurify 在恢复肿瘤内在和免疫信号方面优于自编码器等传统表示学习基线。与原始大量组织谱相比,纯化后的嵌入改善了分子亚型和分级分类,增强了生存模型的一致性,并揭示了具有生物学意义的通路活性。通过提供一个可迁移的框架来去污染大量转录组数据,TwinPurify 扩展了现有临床数据集在分子发现中的效用。
引用
@article{arxiv.2601.18640,
title = {TwinPurify: Purifying gene expression data to reveal tumor-intrinsic transcriptional programs via self-supervised learning},
author = {Zhiwei Zheng and Kevin Bryson},
journal= {arXiv preprint arXiv:2601.18640},
year = {2026}
}