面向家庭收入、消费与支出数据集的分类模型性能评估
机器学习
2021-06-22 v1 人工智能
摘要
由于近期区域与全球层面的粮食短缺,以及主要捐助国为消除长期饥饿所作出的新承诺,粮食安全在当今政策议程中的地位比以往更为突出。机器学习可应用的一个领域是家庭粮食不安全状况的分类。在本研究中,我们建立了一套稳健的方法论,利用机器学习算法对家庭是否处于粮食安全或粮食不安全状态进行分类。本研究使用了十种机器学习算法对家庭的粮食安全状态进行分类,分别为梯度提升(GB)、随机森林(RF)、极端随机树(ET)、装袋(Bagging)、K近邻(KNN)、决策树(DT)、支持向量机(SVM)、逻辑回归(LR)、AdaBoost(AB)和朴素贝叶斯(NB)。随后,我们通过收集HICE调查数据并经由领域专家验证,构建了家庭粮食安全状态数据集并执行分类任务。所有分类器在各性能指标上均取得了较好结果。随机森林与梯度提升模型表现优异,测试准确率分别为0.9997;其余分类器如装袋、决策树、AdaBoost、极端随机树、K近邻、逻辑回归、SVM和朴素贝叶斯的得分分别为0.9996、0.09996、0.9994、0.95675、0.9415、0.8915、0.7853和0.7595。
引用
@article{arxiv.2106.11055,
title = {Performance Evaluation of Classification Models for Household Income, Consumption and Expenditure Data Set},
author = {Mersha Nigus and Dorsewamy},
journal= {arXiv preprint arXiv:2106.11055},
year = {2021}
}