利用加拿大安大略省人群健康数据预测糖尿病
应用统计
2019-04-09 v1 机器学习
摘要
利用健康行政数据(HAD)数据集预测包括糖尿病在内的慢性疾病风险,近来在机器学习界受到大量关注。本文中,我们使用加拿大安大略省患者的最大健康记录数据集。该数据库由临床评估科学研究所(ICES)提供,在年龄、性别和族裔上具有多样性。数据集包含人口统计学信息、实验室测量值、药物福利、医疗系统交互、门诊与住院记录。我们利用该数据开展了首批大规模机器学习研究之一,以研究提前 1–10 年预测糖尿病的任务,其无需对个体进行额外筛查。在最佳设置下,我们使用所有数据集、以 5 年观测窗口加 1 年缓冲训练的单模型达到了 80.3 的测试 AUC。仅使用总计 963 个特征中的前 15 个特征子集即可提供 79.1 的测试 AUC。本文中,我们提供了广泛的机器学习模型性能与特征贡献分析,使我们能够缩小至对糖尿病预测最有用的关键特征。示例包括哮喘和高血压等慢性疾病、实验室结果、保险索赔中的诊断代码、年龄与地理信息。
引用
@article{arxiv.1904.04137,
title = {Diabetes Mellitus Forecasting Using Population Health Data in Ontario, Canada},
author = {Mathieu Ravaut and Hamed Sadeghi and Kin Kwan Leung and Maksims Volkovs and Laura C. Rosella},
journal= {arXiv preprint arXiv:1904.04137},
year = {2019}
}
备注
18 pages, 3 figures, 8 Tables, Submitted to 2019 ML for Healthcare conference