中文

大型医疗数据集中缺失数据的处理:以未知创伤结局为例

应用统计 2020-05-19 v2

摘要

缺失数据的处理是数据预处理中的主要任务之一,尤其是在大型公共服务数据集中。我们分析了来自欧洲最大创伤数据库——创伤审计与研究网络(TARN)数据库的数据。分析中我们使用了165,559例创伤病例。其中有19,289例(13.19\%)结局未知。我们证明这些结局并非“完全随机”缺失,因此尽管有大量可用数据,也不可能简单地将这些病例从分析中排除。我们开发了一套非平稳马尔可夫模型系统来处理缺失结局,并在15,437名受伤后24小时至30天内抵达TARN医院的患者数据上验证了这些模型。我们使用这些马尔可夫模型分析死亡率。特别地,我们校正了观察到的死亡比例。两种朴素方法给出7.20\%(可用病例研究)或6.36\%(如果我们假设所有未知结局均为“存活”)。校正后的值为6.78\%。继Trunkey(1983)的开创性论文之后,死亡率曲线的多模态成为一个被广泛讨论的观点。对于整个分析的TARN数据集,死亡率系数随时间单调下降,但死亡率的分层分析给出了不同结果:对于较低严重度,死亡率系数是伤后时间的非单调函数,并可能在第二和第三周出现最大值。此处开发的方法可应用于经历患者丢失和结局缺失问题的各种医疗数据集。

关键词

引用

@article{arxiv.1604.00627,
  title  = {Handling missing data in large healthcare dataset: a case study of unknown trauma outcomes},
  author = {E. M. Mirkes and T. J. Coats and J. Levesley and A. N. Gorban},
  journal= {arXiv preprint arXiv:1604.00627},
  year   = {2020}
}

备注

Minor editing and additions