利用临床时间序列数据进行预测:一个警示故事
机器学习
2018-12-03 v1 应用统计
机器学习
摘要
在医疗健康领域,患者风险分层模型常利用从电子健康记录中提取的时间序列数据来学习。在为临床预测任务提取数据时,存在若干种表述方式,取决于人们如何选择预测时间与预测区间。本文中,我们展示表述方式如何极大地影响模型性能与临床效用。借助公开可用的 ICU 数据集,我们考虑两项临床预测任务:院内死亡与低钾血症。通过这些案例研究,我们论证了使用与结局无关的参考点评估模型的必要性,因为相对于事件选择预测时间会导致不切实际的性能。此外,在模拟真实世界使用的测试集上,与结局无关的 scheme 在两项任务上均优于与结局有关的 scheme(院内死亡 AUROC .882 对 .831;血清钾:AUROC .829 对 .740)。
引用
@article{arxiv.1811.12520,
title = {Leveraging Clinical Time-Series Data for Prediction: A Cautionary Tale},
author = {Eli Sherman and Hitinder Gurm and Ulysses Balis and Scott Owens and Jenna Wiens},
journal= {arXiv preprint arXiv:1811.12520},
year = {2018}
}
备注
In Proceedings of American Medical Informatics Annual Symposium 2017 PMID: 29854227