中文

结合基因组、转录组和表观基因组数据识别胶质母细胞瘤癌症亚型

基因组学 2013-04-16 v2 机器学习

摘要

我们提出了一种用于多维癌症数据中疾病亚型发现的非参数贝叶斯方法。该方法能够同时分析广泛的数据类型,允许其底层聚类结构之间既存在一致性也存在差异性。该方法包含特征选择,并能根据数据推断最可能的疾病亚型数量。我们将该方法应用于来自癌症基因组图谱 (The Cancer Genome Atlas) 的 277 个胶质母细胞瘤样本,这些样本拥有基因表达、拷贝数变异、甲基化和 microRNA 数据。我们识别出 8 种不同的共识亚型,并研究了它们对死亡、新肿瘤事件、进展和复发的预后价值。共识亚型对肿瘤复发具有预后意义(经多重假设检验校正后的 log-rank pp 值为 3.6×1043.6 \times 10^{-4})。这主要由甲基化数据驱动(log-rank pp 值为 2.0×1032.0 \times 10^{-3}),但其他 3 种数据类型增强了该效应,证明了整合多种数据类型的价值。特别值得注意的是一个包含 47 名患者的亚型,其特征为极低水平的甲基化。该亚型的肿瘤复发率极低,且在 10 年随访期内无新事件发生。我们还识别出一个包含 6 名患者的小型基因表达亚型,其显示出特别差的生存结果。此外,我们注意到一个共识亚型显示出高度独特的数据特征,表明它是胶质母细胞瘤的一个生物学上独特的亚型。代码可从 https://sites.google.com/site/multipledatafusion/ 获取。

关键词

引用

@article{arxiv.1304.3577,
  title  = {Identifying cancer subtypes in glioblastoma by combining genomic, transcriptomic and epigenomic data},
  author = {Richard S. Savage and Zoubin Ghahramani and Jim E. Griffin and Paul Kirk and David L. Wild},
  journal= {arXiv preprint arXiv:1304.3577},
  year   = {2013}
}