中文

使用遗传算法确定献血者数据库中布尔字段值预测的最佳分类器

机器学习 2018-08-07 v4 机器学习

摘要

动机:得益于数字化,我们常能访问由各类信息字段组成的大型数据库,范围从数值到文本甚至布尔值。此类数据库尤其适合机器学习、分类与大数据分析任务。我们能够在已有数据上训练分类器,并给定其他字段信息时用于预测某一字段的值。具体而言,本研究关注医院汇编的电子健康记录(EHRs)。这些 EHRs 是访问个体患者数据的便利手段,但作为整体处理仍是一项任务。然而,由连贯、良好制表结构组成的 EHRs 十分适合通过分类器应用于机器学习。本研究中,我们考察一个献血服务中心数据集(取自台湾新竹市献血服务中心的数据)。我们使用 python 中的 scikit-learn 机器学习。从支持向量机(SVM)中,我们使用支持向量分类(SVC);从线性模型中导入感知机。我们还使用了 K.neighborsclassifier 与决策树分类器。此外,我们使用 TPOT 库通过遗传算法寻找优化流水线。使用上述分类器,我们通过 k 折交叉验证对每个分类器进行评分。联系方式:[email protected] GitHub 仓库:https://github.com/ritabratamaiti/Blooddonorprediction

关键词

引用

@article{arxiv.1802.07756,
  title  = {Determining the best classifier for predicting the value of a boolean field on a blood donor database using genetic algorithms},
  author = {Ritabrata Maiti},
  journal= {arXiv preprint arXiv:1802.07756},
  year   = {2018}
}

备注

GitHub Repository here: https://github.com/ritabratamaiti/Blooddonorprediction