数据类别对再入院预测准确率的贡献
定量方法
2018-03-23 v2
摘要
识别高再入院风险的患者有助于降低发病率与死亡率以及医疗成本。现有的大多数再入院预测研究未比较各数据类别的贡献。在本研究中,我们分析了163,468名患者的398,884条入院记录中的90,101个变量的相对贡献,包括患者人口统计学特征、历史住院信息、出院去向、诊断、手术、用药及实验室检查结果。我们在scikit-learn中基于Logistic Regression建立了一个可解释的再入院预测模型,并将可用变量逐一加入模型,以分析各数据类别对再入院预测准确率的影响。诊断相关组(c统计量增加0.0933)和出院去向(c统计量增加0.0269)是对模型准确率贡献最大的因素。此外,我们还确定了每个数据类别中贡献排名前十的变量。
引用
@article{arxiv.1803.07850,
title = {Contribution of Data Categories to Readmission Prediction Accuracy},
author = {Wendong Ge and Hee Yeun Kim and Sonali Desai and Leonid Perlovsky and Alexander Turchin},
journal= {arXiv preprint arXiv:1803.07850},
year = {2018}
}