中文

数据类别对再入院预测准确率的贡献

定量方法 2018-03-23 v2

摘要

识别高再入院风险的患者有助于降低发病率与死亡率以及医疗成本。现有的大多数再入院预测研究未比较各数据类别的贡献。在本研究中,我们分析了163,468名患者的398,884条入院记录中的90,101个变量的相对贡献,包括患者人口统计学特征、历史住院信息、出院去向、诊断、手术、用药及实验室检查结果。我们在scikit-learn中基于Logistic Regression建立了一个可解释的再入院预测模型,并将可用变量逐一加入模型,以分析各数据类别对再入院预测准确率的影响。诊断相关组(c统计量增加0.0933)和出院去向(c统计量增加0.0269)是对模型准确率贡献最大的因素。此外,我们还确定了每个数据类别中贡献排名前十的变量。

关键词

引用

@article{arxiv.1803.07850,
  title  = {Contribution of Data Categories to Readmission Prediction Accuracy},
  author = {Wendong Ge and Hee Yeun Kim and Sonali Desai and Leonid Perlovsky and Alexander Turchin},
  journal= {arXiv preprint arXiv:1803.07850},
  year   = {2018}
}