中文

孟加拉国儿童死亡率预测:十年验证研究

机器学习 2026-02-05 v1 计算机与社会

摘要

儿童死亡率预测的机器学习模型倾向于在未来人群中表现不准确,因为它们因交叉验证中使用的随机化而受 look-ahead bias 的影响。使用来自孟加拉国 2011-2022 年的人口与健康调查(DHS)数据(n = 33,962),本文进行了研究。我们在 (2011-2014) 数据上训练模型,在 2017 年数据上验证,在 2022 年数据上测试。初始测试后八年,基于遗传算法的神经网络架构搜索发现,单层神经网络(64 个单元)优于 XGBoost(AUROC = 0.76 vs. 0.73;p < 0.01)。此外,通过详细的公平性审计,我们识别出一种整体的“社会经济预测梯度”,表现出区域贫困水平(r = -0.62)与算法 AUC 之间的正相关。在此基础上,我们发现该模型在最贫困地区的表现最佳(AUC 0.74),而在最富裕地区的表现则显著下降(AUC 0.66)。这些发现表明,该模型正在识别最需要干预的地区。我们的模型在以 10% 水平筛查时,比 Gradient Boosting 模型多识别约 1300 名风险儿童,经由 SHAP 值和 Platt Calibration 验证,因此提供了一个稳健、可投入生产的计算表型,用于针对性母婴健康干预。

关键词

引用

@article{arxiv.2602.03957,
  title  = {Child Mortality Prediction in Bangladesh: A Decade-Long Validation Study},
  author = {Md Muhtasim Munif Fahim and Md Rezaul Karim},
  journal= {arXiv preprint arXiv:2602.03957},
  year   = {2026}
}