中文

基于贝叶斯多域学习的下一代测序计数数据癌症亚型发现

机器学习 2018-10-23 v1 机器学习 基因组学 应用统计

摘要

精准医学旨在利用近期基因组规模的高通量分析技术(包括下一代测序(NGS))实现个性化预后与治疗。然而,NGS 数据的转化面临若干挑战。首先,NGS 计数数据常常过度离散,需要恰当建模。其次,相较于所涉分子数量与系统复杂性,用于研究诸如癌症等复杂疾病的可用样本数往往有限,尤其考虑到疾病异质性。关键问题在于,我们能否整合来自所有不同来源或域的可用数据,以基于 NGS 计数数据实现可复现的疾病预后。在本文中,我们发展了贝叶斯多域学习(BMDL)模型,该模型基于层次负二项因子分解推导过度离散计数数据的域依赖潜在表示,从而即使在特定癌症类型样本数较少时也能准确进行癌症分型。来自我们的模拟数据及 The Cancer Genome Atlas (TCGA) 的 NGS 数据集的实验结果,展示了 BMDL 在有效多域学习中避免现有多任务学习与迁移学习方法常出现的“负迁移”效应的良好潜力。

关键词

引用

@article{arxiv.1810.09433,
  title  = {Bayesian multi-domain learning for cancer subtype discovery from next-generation sequencing count data},
  author = {Ehsan Hajiramezanali and Siamak Zamani Dadaneh and Alireza Karbalayghareh and Mingyuan Zhou and Xiaoning Qian},
  journal= {arXiv preprint arXiv:1810.09433},
  year   = {2018}
}

备注

32nd Conference on Neural Information Processing Systems (NIPS 2018)