中文

用于分析巴西患者 Covid19 数据集的数据挖掘方法

计算机与社会 2020-08-27 v1

摘要

由冠状病毒(covid-19)引发的疫情,其名称由世界卫生组织于 2020 年首月创造。实际上,几乎所有国家均出现 covid19 阳性病例,各国政府正选择不同卫生政策以阻断感染,许多研究组正基于患者数据理解该病毒,同时科学家在寻找增强免疫系统以应对 covid19 病毒的疫苗。感染最多的国家之一为巴西,截至 8 月 11 日累计 3,112,393 例。圣保罗州研究基金会(Fapesp)发布了一个数据集,这是与医院(Einstein、Sirio-Libanes)、实验室(Fleury)及圣保罗大学协作的创新之举,以推动该热点主题的研究。本文使用数据挖掘方法对数据集进行探索性分析,发现了一些不一致,即 NaN 值、分析物的空引用值、分析物结果的离群值、编码问题。结果得到了供未来研究的清洗后数据集,但至少 20% 数据因非数值、空值及超出参考范围的数字被丢弃。

关键词

引用

@article{arxiv.2008.11344,
  title  = {Data Mining Approach to Analyze Covid19 Dataset of Brazilian Patients},
  author = {Josimar E. Chire Saire},
  journal= {arXiv preprint arXiv:2008.11344},
  year   = {2020}
}