基于WEKA数据挖掘工具的登革热疾病预测
计算机与社会
2015-02-19 v1 机器学习
摘要
登革热是一种威胁生命的疾病,在印度等发达国家与发展中国家中流行。本文讨论已用于登革热疾病预测的各种数据挖掘算法方法。数据挖掘是卫生机构用于生物信息学研究中疾病(如登革热、糖尿病和癌症)分类的知名技术。在提出的方法中,我们使用WEKA,通过10折交叉验证来评估数据并比较结果。WEKA拥有大量不同的机器学习与数据挖掘算法。本文首先分类登革热数据集,然后通过Explorer、knowledge flow和Experimenter界面比较WEKA中不同的数据挖掘技术。此外,为验证我们的方法,我们使用了一个含108个实例的登革热数据集,但WEKA使用了99行和18个属性,通过不同算法的分类确定疾病预测及其准确度,以找出最佳性能。本文主要目标是对数据进行分类,帮助用户从数据中提取有用信息,并从中轻松识别适用于准确预测模型的合适算法。从本文结果可得出结论,朴素贝叶斯(Naive Bayes)和J48是分类准确度最佳性能的算法,因为它们以99个正确分类实例实现了最大准确度=100%、最大ROC=1、最小平均绝对误差,且通过Explorer和Knowledge flow构建模型耗时最少。
引用
@article{arxiv.1502.05167,
title = {Dengue disease prediction using weka data mining tool},
author = {Kashish Ara Shakil and Shadma Anis and Mansaf Alam},
journal= {arXiv preprint arXiv:1502.05167},
year = {2015}
}