中文

非平稳健康记录中的特征鲁棒性:常见临床机器学习任务中可部署模型性能的隐患

机器学习 2019-08-05 v1 机器学习

摘要

当从电子健康记录(EHRs)训练临床预测模型时,一个关键问题在于模型部署后随时间维持性能的能力,即便诊疗实践、数据库系统和人群人口统计学特征不断演化。然而,由于去标识化要求,当前公共 EHR 基准(如 MIMIC-III 重症监护数据集)的实验实践与时间无关,将诊疗记录分配到训练或测试集时不考虑实际的诊疗日期。因此,当前基准无法评估在某一年训练的模型对另一年的泛化能力。在本工作中,我们获得有限数据使用协议以访问 MIMIC 中每条记录的诊疗年份,并表明所有被测最先进模型在 historical 数据上训练、future 数据上测试时预测质量均下降,尤其是对 2008 年一次全系统记录保存变更的响应(随机森林分类器在死亡预测上 AUROC 下降 0.29,在住院时长预测上 AUROC 下降 0.10)。我们进一步开发了一种简单而有效的缓解策略:通过将原始特征聚合成专家定义的临床概念,死亡预测 AUROC 仅下降 0.06,住院时长预测 AUROC 仅下降 0.03。我们证明该聚合策略优于其他旨在增强对数据漂移鲁棒性的自动特征预处理技术。我们发布聚合表示与代码,以鼓励更可部署的临床预测模型。

关键词

引用

@article{arxiv.1908.00690,
  title  = {Feature Robustness in Non-stationary Health Records: Caveats to Deployable Model Performance in Common Clinical Machine Learning Tasks},
  author = {Bret Nestor and Matthew B. A. McDermott and Willie Boag and Gabriela Berner and Tristan Naumann and Michael C. Hughes and Anna Goldenberg and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:1908.00690},
  year   = {2019}
}