中文

隐藏基因组主题发现:基于贝叶斯多层上下文学习方法的潜在癌症突变主题挖掘

统计方法学 2023-01-02 v1 应用统计 统计计算

摘要

针对集体超罕见全基因组体细胞突变的癌症部位特异性的统计推断是一个开放问题。传统统计方法无法处理全基因组突变数据,因为其超高维度和极端数据稀疏性——例如,在本文考虑的约 1700 个全基因组肿瘤数据集中观察到超过 3000 万个独特变异,其中超过 99% 的变异仅出现一次。为利用这些罕见变异中的信息,我们最近提出了“隐藏基因组模型”,这是一种形式化的多层多逻辑模型,可挖掘超罕见体细胞变异中的信息以刻画肿瘤类型。该模型通过利用个体突变上下文的层次化层来浓缩罕见变异中的信号。该模型目前采用一致、可扩展的点估计技术实现,可处理在数千个肿瘤中检测到的数千万个变异。我们近期的出版物已证明其在大规模下的惊人准确性与可归因性。然而,由于突变上下文的数量、相关性和不可解释性,从该模型进行有原则的统计推断是不可行的。本文我们提出了一种新颖的框架,利用计算语言学领域的主题模型来对模型中使用的突变上下文进行可解释的降维。所提模型采用高效的 MCMC 算法实现,该算法允许在比现成高维多类回归方法和软件能力强几个数量级的规模上进行严格的完整贝叶斯推断。我们在全基因组癌症分析(PCAWG)数据集上应用我们的模型,结果揭示了有趣的新见解。

关键词

引用

@article{arxiv.2212.14567,
  title  = {Topical Hidden Genome: Discovering Latent Cancer Mutational Topics using a Bayesian Multilevel Context-learning Approach},
  author = {Saptarshi Chakraborty and Zoe Guan and Colin B. Begg and Ronglai Shen},
  journal= {arXiv preprint arXiv:2212.14567},
  year   = {2023}
}

备注

Keywords: multilevel Bayesian models; whole genome data; rare somatic variants; topic model; context learning; Markov chain Monte Carlo