面向非洲肯尼亚娅马地区基于机器学习的儿童疫苗预测——使用合成数据
机器学习
2026-04-13 v1
摘要
背景:在资源有限的地区,数据利用受限构成了疫苗供应链的障碍,削弱了实现公平免疫覆盖的努力。在游牧人群中,个体面临漏掉关键疫苗剂量的风险增加。娅马地区肯尼亚诺罗克县的娅马人就是其中之一,该地区缺乏高质量数据,阻碍了准确的覆盖率估计,妨碍了资源的有效分配,削弱了及时干预的能力。此外,数据隐私问题在数据有限的群体中尤为突出。目标:首先,我们旨在识别大规模人群中风险儿童,以提供及时、以证据为依据的干预措施,支持提高疫苗覆盖率。其次,我们旨在更好地保护易感健康数据的隐私。方法:我们数字化了来自卫生部510登记处(n=6,913)8年的儿童疫苗记录,并应用机器学习模型(Logistic回归和XGBoost)来识别风险儿童。此外,我们利用一种新颖的表格扩散式合成数据生成方法(TabSyn)来保护模型中的患者隐私。结果:我们的发现表明,分类技术可可靠且成功地预测儿童风险漏疫,某些疫苗的召回率、精确率和F1分数均超过90%。此外,使用合成数据而非真实数据训练这些模型,即可在不损失预测性能的情况下保留原始数据集中个体的隐私。结论:这些结果支持在数字基础设施有限的诊所中实施合成数据,以实现健康信息学中的隐私保护、可扩展的预测,为儿童免疫覆盖提供支持。
引用
@article{arxiv.2604.08902,
title = {Using Synthetic Data for Machine Learning-based Childhood Vaccination Prediction in Narok, Kenya},
author = {Jimmy Bach and Yang Li and Yaqi Liu and John Sankok and Rose Kimani and Carrie B. Dolan and Julius N. Odhiambo and Haipeng Chen},
journal= {arXiv preprint arXiv:2604.08902},
year = {2026}
}