中文

亲和网络融合与半监督学习用于癌症患者聚类

定量方法 2018-05-25 v1

摘要

界定癌症等复杂疾病的亚型,并对患有同种疾病但亚型不同的患者群体进行分层以实现靶向治疗,对个性化和精准医学具有重要意义。相较于仅使用单一数据类型的方法,整合多组学数据的途径在患者聚类和疾病亚型发现上更具优势。然而,由于多组学数据具有异质性和噪声,其整合颇具挑战。本文提出亲和网络融合(ANF)以整合多组学数据进行患者聚类。ANF首先针对每种组学数据类型构建患者亲和网络,随后计算用于谱聚类的融合网络。我们将ANF应用于从GDC数据门户下载的、经处理的 harmonized 癌症数据集(包含2193名患者),在将患者聚类至正确疾病类型方面取得了有前景的结果。此外,我们开发了结合ANF与神经网络的半监督模型用于少样本学习。在若干案例中,该模型在仅使用不到1%数据训练时,于测试集上可达到超过90%的准确率。这展示了ANF在学习良好患者表征方面的能力,并表明半监督学习在癌症患者聚类中具有巨大潜力。

关键词

引用

@article{arxiv.1805.09673,
  title  = {Affinity Network Fusion and Semi-supervised Learning for Cancer Patient Clustering},
  author = {Tianle Ma and Aidong Zhang},
  journal= {arXiv preprint arXiv:1805.09673},
  year   = {2018}
}

备注

Accepted to Methods (https://www.journals.elsevier.com/methods). arXiv admin note: text overlap with arXiv:1708.07136