中文

利用欠采样与集成学习识别早产影响因素

应用统计 2020-09-24 v1 统计方法学

摘要

在本文中,我们提出集成学习(Ensemble Learning)模型以识别导致早产的因素。我们的工作利用了由 NIEHS P42 中心收集的一个丰富数据集,该中心试图找出波多黎各北部早产率高的主要致因。我们研究了应对数据集中两大挑战的分析模型:1) 数据集中大量不完整数据,以及 2) 数据集中的类别不平衡。首先,我们利用并比较两类缺失数据填补方法:1) 基于均值的方法和 2) 基于相似度的方法,从而提高了该数据集的完整性。其次,我们提出一种基于欠采样与集成学习相结合的特征选择与评估模型,以解决数据集中的类别不平衡问题。我们利用并比较多种集成特征选择方法,包括完全线性聚合(CLA)、加权平均聚合(WMA)、特征出现频率(OFA)和基于分类精度的聚合(CAA)。为进一步处理各特征中存在的缺失数据,我们提出两种新方法:1) 基于缺失数据率与精度的聚合(MAA),以及 2) 基于熵与精度的聚合(EAA)。这两种提出的模型在特征选择过程中平衡了由缺失数据处理所引入的数据方差程度,同时保持了模型性能。我们的结果显示,相较于先前最先进(state-of-the-art)的方法,灵敏度相对于误报率提升了 42%。

关键词

引用

@article{arxiv.2009.11242,
  title  = {Using Undersampling with Ensemble Learning to Identify Factors Contributing to Preterm Birth},
  author = {Shi Dong and Zlatan Feric and Guangyu Li and Chieh Wu and April Z. Gu and Jennifer Dy and John Meeker and Ingrid Y. Padilla and Jose Cordero and Carmen Velez Vega and Zaira Rosario and Akram Alshawabkeh and David Kaeli},
  journal= {arXiv preprint arXiv:2009.11242},
  year   = {2020}
}