中文

CN-SBM:针对原发与残余拷贝数变异的分类块模型

机器学习 2025-07-01 v1 机器学习 基因组学

摘要

癌症是一种遗传性疾病,其克隆演化可通过追踪含噪的全基因组拷贝数变异来监测。我们引入了拷贝数随机块模型(CN-SBM),这是一个基于二分分类块模型、利用离散拷贝数状态对样本和基因组区域进行联合聚类的概率框架。与依赖高斯或泊松假设的模型不同,CN-SBM 尊重 CNV 调用结果的离散性质,并通过块状结构捕捉亚群特异性模式。采用两阶段方法,CN-SBM 将 CNV 数据分解为原发成分和残余成分,从而能够检测大规模染色体改变和更细微的畸变。我们推导了一种可扩展的变分推断算法,以应用于大队列和高分辨率数据。在模拟和真实数据集上的基准测试表明,相较于现有方法,模型拟合度有所提高。应用于 TCGA 低级别胶质瘤数据时,CN-SBM 揭示了临床相关的亚型和结构化的残余变异,有助于生存分析中的患者分层。这些结果确立了 CN-SBM 作为一个可解释、可扩展的 CNV 分析框架,与肿瘤异质性和预后直接相关。

关键词

引用

@article{arxiv.2506.22963,
  title  = {CN-SBM: Categorical Block Modelling For Primary and Residual Copy Number Variation},
  author = {Kevin Lam and William Daniels and J Maxwell Douglas and Daniel Lai and Samuel Aparicio and Benjamin Bloem-Reddy and Yongjin Park},
  journal= {arXiv preprint arXiv:2506.22963},
  year   = {2025}
}

备注

8 pages, 4 figures