中文

应用监督学习算法与一种新的特征选择方法预测冠状动脉疾病

机器学习 2014-02-04 v1 机器学习

摘要

本文从数据科学的新视角出发,讨论了基于安大略心脏基因组研究 (OHGS) 收集的 DNA 碱基对水平的遗传变异(称为单核苷酸多态性,SNPs)来预测冠状动脉疾病的问题。首先,本文解释了两种常用的监督学习算法:k-近邻 (k-NN) 分类器和随机森林分类器,并提供了 k-NN 分类器在任何有限维赋范向量空间中具有普遍一致性的完整证明。其次,本文介绍了两个降维步骤:基于 Johnson-Lindenstrauss 引理的已知特征提取技术随机投影,以及一种针对离散领域的新方法,称为质量传输距离 (MTD) 特征选择。随后,本文比较了随机投影结合 k-NN 分类器与 MTD 特征选择结合随机森林在预测动脉疾病方面的性能,评估指标包括准确率、F-度量以及受试者工作特征 (ROC) 曲线下面积。对比结果表明,结合随机森林的 MTD 特征选择远优于随机投影和 k-NN。当使用 MTD 特征选择选出 3335 个 SNPs 进行分类时,随机森林分类器在 OHGS 遗传数据集上获得了 0.6660 的准确率和 0.8562 的 ROC 曲线下面积。这一结果显著优于 Davies 等人于 2010 年在同一数据集上获得的 0.608 的先前最高分。

关键词

引用

@article{arxiv.1402.0459,
  title  = {Applying Supervised Learning Algorithms and a New Feature Selection Method to Predict Coronary Artery Disease},
  author = {Hubert Haoyang Duan},
  journal= {arXiv preprint arXiv:1402.0459},
  year   = {2014}
}

备注

This is a Master of Science in Mathematics thesis under the supervision of Dr. Vladimir Pestov and Dr. George Wells submitted on January 31, 2014 at the University of Ottawa; 102 pages and 15 figures