中文

用于群体规模聚类与生物祖源推断的卷积嵌入网络

机器学习 2020-04-21 v2 定量方法 机器学习

摘要

遗传变异的研究有助于发现相关的群体以识别易患常见疾病的队列,并解释疾病易感性的差异及患者对药物的反应。机器学习算法正日益应用于识别相互作用的 GVs 以理解其复杂表型性状。由于学习算法的性能不仅取决于数据的大小与性质,也取决于底层表征的质量,深度神经网络可学习非线性映射,从而将 GVs 数据转化为比人工特征选择更利于聚类与分类的表征。本文中,我们提出卷积嵌入网络,其中结合两种 DNN 架构,即卷积嵌入聚类与卷积自编码器分类器,分别用于基于 GVs 的个体聚类与地理族裔预测。我们在来自 1000 genomes 与 Simons 基因组多样性项目的 9500 万 GVs 上采用基于 CAE 的表征学习。侧重准确性与可扩展性的定量与定性分析表明,我们的方法优于 VariantSpark 与 ADMIXTURE 等最先进方法。特别地,CEC 可在 22 小时内以 0.915 的调整兰德指数、0.92 的归一化互信息及 89% 的聚类准确率对目标群体进行聚类。相反,CAE 分类器能以 0.9004 的 F1 与 0.8245 的 Mathews 相关系数(MCC) 分数预测未知样本的地理族裔。为提供预测解释,我们使用梯度提升树(GBT) 与 SHAP 识别显著生物标志物。总体而言,我们的方法透明且快于基线方法,并可扩展至全人类基因组的 5% 至 100%。

关键词

引用

@article{arxiv.1805.12218,
  title  = {Convolutional Embedded Networks for Population Scale Clustering and Bio-ancestry Inferencing},
  author = {Md. Rezaul Karim and Michael Cochez and Achille Zappa and Ratnesh Sahay and Oya Beyan and Dietrich-Rebholz Schuhmann and Stefan Decker},
  journal= {arXiv preprint arXiv:1805.12218},
  year   = {2020}
}

备注

This article is under review in IEEE/ACM Transactions on Computational Biology and Bioinformatics. It is based on a workshop paper discussed at the Extended Semantic Web Conference (ESWC'2017) workshop on Semantic Web Solutions for Large-scale Biomedical Data Analytics (SeWeBMeDA), Slovenia, May, 28-29, 2017