基于集成机器学习模型的埃塞俄比亚妊娠期营养状况数据驱动预测
机器学习
2025-09-19 v1
摘要
妊娠期营养不良是埃塞俄比亚面临的重大公共卫生挑战,增加了并发妊娠和新生儿不良 outcome 的风险。传统的统计方法往往难以捕捉营养状况决定因素的复杂和多维特征。本研究采用集成机器学习技术开发了预测模型,利用来自埃塞俄比亚人口与健康调查(2005-2020)的数据,包含18,108条记录,涉及30个社会人口学和健康属性。数据预处理包括处理缺失值、归一化以及采用SMOTE平衡数据,随后进行特征选择以识别关键预测因子。应用多种监督式集成算法,包括XGBoost、随机森林、CatBoost和AdaBoost,对营养状况进行分类。其中,随机森林模型取得最佳性能,将女性划分为四个类别(正常、轻度营养不良、中度营养不良和超重),准确率达97.87%,精确率为97.88%,召回率为97.87%,F1分数为97.87%,ROC AUC为99.86%。这些发现表明,集成学习在从复杂数据集中捕捉隐藏模式方面具有有效性,为及时识别营养风险提供了实用工具。结果为医疗保健人员、政策制定者和研究者提供了数据驱动的策略,支持改善埃塞俄比亚妊娠期营养和健康结果。
引用
@article{arxiv.2509.14945,
title = {Data-Driven Prediction of Maternal Nutritional Status in Ethiopia Using Ensemble Machine Learning Models},
author = {Amsalu Tessema and Tizazu Bayih and Kassahun Azezew and Ayenew Kassie},
journal= {arXiv preprint arXiv:2509.14945},
year = {2025}
}
备注
9 pages, 5 figures, 2 Tables