中文

MS-ConTab:用于泛癌症表征与分层的突变特征多尺度对比学习

机器学习 2025-08-29 v1 定量方法

摘要

动机。了解泛癌症突变景观为理解肿瘤发生的分子机制提供了关键见解。虽然患者层面的机器学习技术已被广泛用于识别肿瘤亚型,但队列层面的聚类(即基于共享的分子特征对整个癌症类型进行分组)在很大程度上依赖于经典的统计方法。结果。在本研究中,我们引入了一种新颖的无监督对比学习框架,基于源自 COSMIC 数据库的编码突变数据对 43 种癌症类型进行聚类。对于每种癌症类型,我们构建了两种互补的突变特征:一种基因级图谱,用于捕获最常突变基因中的核苷酸替换模式;另一种染色体级图谱,用于表示跨染色体的标准化替换频率。这两种视图使用 TabNet 编码器进行编码,并通过多尺度对比学习目标(NT-Xent 损失)进行优化,以学习统一的癌症类型嵌入。我们证明,由此产生的潜在表征产生了具有生物学意义的癌症类型聚类,与已知的突变过程和组织起源相一致。我们的工作代表了对比学习在队列层面癌症聚类中的首次应用,为突变驱动的癌症亚型分型提供了一个可扩展且可解释的框架。

关键词

引用

@article{arxiv.2508.19424,
  title  = {MS-ConTab: Multi-Scale Contrastive Learning of Mutation Signatures for Pan Cancer Representation and Stratification},
  author = {Yifan Dou and Adam Khadre and Ruben C Petreaca and Golrokh Mirzaei},
  journal= {arXiv preprint arXiv:2508.19424},
  year   = {2025}
}