利用堆叠自编码器提取2型糖尿病全基因组数据中的上位性相互作用
机器学习
2018-08-30 v1 机器学习
摘要
2型糖尿病是全球范围内一个主要的公共卫生问题,其日益增长的患病率对所有国家的健康和经济都具有重要意义。该疾病是一种具有复杂病因的多因素紊乱。其遗传决定因素在很大程度上仍不清楚,仅鉴定出少数候选基因。全基因组关联研究(GWAS)有望显著增强我们对常见复杂疾病基于遗传的决定因素的理解。迄今为止,利用GWAS已鉴定出83个2型糖尿病的单核苷酸多态性(SNPs)。用于单 locus 和多 locus 分析的标准统计检验(如逻辑回归)在理解复杂人类疾病的遗传结构方面收效甚微。逻辑回归被建模以捕捉线性相互作用,但忽略了遗传数据中存在的非线性上位性相互作用。在复杂疾病中检测上位性相互作用迫在眉睫,因为这可能解释此类疾病中剩余的缺失遗传率。在本文中,我们提出了一种基于深度学习算法的新框架,用于处理全基因组关联数据中存在的非线性上位性相互作用。在加性遗传模型下,针对基因组控制膨胀因子进行调整的逻辑关联分析被用于剔除统计上不可能的SNPs,以最小化计算开销。
引用
@article{arxiv.1808.09517,
title = {Extracting Epistatic Interactions in Type 2 Diabetes Genome-Wide Data Using Stacked Autoencoder},
author = {Basma Abdulaimma and Paul Fergus and Carl Chalmers},
journal= {arXiv preprint arXiv:1808.09517},
year = {2018}
}
备注
9 pages, 1 figure