中文

基于机器学习和深度学习预测尼泊尔地区低年龄儿童贫血

机器学习 2026-02-03 v1

摘要

儿童贫血仍是尼泊尔的一个重大公共卫生挑战,与生长受损、认知功能受损以及增加疾病负担相关。我们采用世界卫生组织血红蛋白阈值,对6-59个月龄的儿童进行贫血状态定义,并将所有贫血严重程度分为 \emph{贫血} \ versus \emph{不贫血} \ of \emph{anemic} \ versus \\emph{not anemic} \},构建二分类任务。我们分析了尼泊尔人口普查与健康调查(NDHS 2022)微数据,包含1855名儿童,最初考虑48个候选特征,涵盖人口学、社会经济、母亲及儿童健康特征。为获得稳定且有依据的特征集,我们应用四种特征选择技术(卡方检验、互信息、point-biserial 相关和 Boruta 方法),并优先选择由多方法共识支持的特征。结果显示,儿童年龄、近期发热、家庭规模、母亲贫血和寄生虫驱虫是所有方法一致选中的五个特征,而经期、民族指标和省份则经常被保留。随后,我们将八种传统机器学习分类器(逻辑回归、K最近邻、决策树、随机森林、XGBoost、支持向量机、朴素贝叶斯、线性判别分析)与两种深度学习模型(深度神经网络和 TabNet)进行比较,使用标准评估指标,强调F1分数和召回率 due to class imbalance。所有模型中,逻辑回归取得最佳召回率(0.701)和最高F1分数(0.649),深度神经网络实现最高准确率(0.709),支持向量机获得最强区分度,即最高AUC(0.736)。总体而言,结果表明机器学习和深度学习模型都能提供具竞争力的贫血预测,儿童年龄、感染代理、母亲贫血和驱虫史等可解释特征是风险分层和公共卫生筛查的核心因素。

关键词

引用

@article{arxiv.2602.01005,
  title  = {Predicting Anemia Among Under-Five Children in Nepal Using Machine Learning and Deep Learning},
  author = {Deepak Bastola and Pitambar Acharya and Dipak Dulal and Rabina Dhakal and Yang Li},
  journal= {arXiv preprint arXiv:2602.01005},
  year   = {2026}
}

备注

13 pages and submission to Public Health Nutrition is in progress