中文

基于遗传编程的全基因组关联研究中复杂疾病自动分析

神经与进化计算 2017-02-08 v1 机器学习 定量方法 机器学习

摘要

近年来,机器学习为满足高效分析并理解全球医疗系统中不断增长的生物医学数据库的工具需求而获得关注。然而,有效使用机器学习方法需要相当的领域专业知识,这可能对刚接触计算数据科学方法的生物信息学家构成进入壁垒。因此,使机器学习更易用的现成工具对生物信息学家而言可能非常宝贵。为此,我们开发了一个开源流水线优化工具(TPOT-MDR),它使用遗传编程为生物信息学研究自动设计机器学习流水线。在TPOT-MDR中,我们实现多因子降维(MDR)作为建模高阶特征交互的特征构建方法,并将其与一种新的专家知识引导的特征选择器结合用于大型生物医学数据集。我们使用来自人类遗传学的模拟和真实世界数据集组合展示了TPOT-MDR的能力,发现TPOT-MDR显著优于现代机器学习方法,如逻辑回归和极端梯度提升(XGBoost)。我们进一步分析了TPOT-MDR为真实世界问题发现的最佳流水线,并突出了TPOT-MDR产生高准确度且易于解释的解决方案的能力。

关键词

引用

@article{arxiv.1702.01780,
  title  = {Toward the automated analysis of complex diseases in genome-wide association studies using genetic programming},
  author = {Andrew Sohn and Randal S. Olson and Jason H. Moore},
  journal= {arXiv preprint arXiv:1702.01780},
  year   = {2017}
}

备注

9 pages, 4 figures, submitted to GECCO 2017 conference and currently under review