常规卫生监测数据集系统清洗方法:基于印度旁遮普邦国家病媒传播疾病控制规划数据的示例
计算机与社会
2021-08-24 v1
摘要
ICT4D与数据科学的进步促进了系统、可复现且可扩展的数据清洗,以加强常规卫生信息系统。本研究采用了一个数据清洗逻辑模型,该模型包含一种基于规则、交互式且半自动的算法,用于数据集的筛查、诊断和编辑。我们准备了先验计算工作流和操作定义。利用印度旁遮普邦国家病媒传播疾病控制规划2015年1月1日至2019年12月31日的登革热线列表说明了模型性能。对于2015年和2016年,估计日期的清洗和填补分别成功处理了96.1%和98.9%的记录,2017年、2018年和2019年所有病例均成功处理。年龄和性别信息的清洗与提取分别覆盖了超过98.4%和99.4%的记录。该逻辑模型的应用产生了一个可用于分析的数据集,可用于理解时空流行病学并促进基于数据的公共卫生决策。
引用
@article{arxiv.2108.09963,
title = {A Systematic Approach to Cleaning Routine Health Surveillance Datasets: An Illustration Using National Vector Borne Disease Control Programme Data of Punjab, India},
author = {Gurpreet Singh and Biju Soman and Arun Mitra},
journal= {arXiv preprint arXiv:2108.09963},
year = {2021}
}
备注
In proceedings of the 1st Virtual Conference on Implications of Information and Digital Technologies for Development, 2021