中文

面向统计学习并处理缺失值的特征选择方法:以创业生存数据集为例

机器学习 2018-10-03 v1 机器学习

摘要

在本文中,我们利用带特征选择的数据挖掘方法,研究可增强微型和小型企业(MSE)生存判别能力的特征。针对数据集的复杂性,我们提出了三种数据填补方法的比较,即均值填补(MI)、k近邻(KNN)与期望最大化(EM),并共同使用变量选择技术(先经t检验),随后通过逻辑回归分类方法、朴素贝叶斯算法、线性判别分析与支持向量机进行数据挖掘过程,从而比较它们各自的性能。实验结果将用于构建预测MSE生存率的模型,从而更好地理解该主题,因为其为巴西GPA与宏观经济的重要组成部分。

关键词

引用

@article{arxiv.1810.01061,
  title  = {Feature Selection Approach with Missing Values Conducted for Statistical Learning: A Case Study of Entrepreneurship Survival Dataset},
  author = {Diego Nascimento and Anderson Ara and Francisco Louzada Neto},
  journal= {arXiv preprint arXiv:1810.01061},
  year   = {2018}
}