中文

重新审视临床预测:机器学习为何必须考虑诊疗年份与特征聚合

机器学习 2018-12-03 v1 机器学习

摘要

医疗领域的机器学习常在去标识化数据集上训练模型,且日历日期被随机偏移,忽视了数据是在随时间变化的医院运营实践下产生的这一事实。这些变化的实践导致观测数据发生确定性改变,从而使未考虑日期的评估产生混淆,并限制了与日期无关的模型的泛化能力。本工作中,我们在公共医院数据集 MIMIC 上确立了该问题的严重程度,并展示了一个简单解法。我们用提供诊疗的年份扩充 MIMIC,表明使用标准特征表示训练的模型质量会随时间显著下降。我们发现,在晚 10 年的数据上评估死亡率预测时 AUC 下降 0.3;住院时长预测的 AUC 类似地下降 0.15。相比之下,我们证明面向临床的原始特征聚合能显著缓解未来的性能下降。我们建议的聚合表示在每年重新训练时,其预测质量可与忽略年份的模型相媲美。

关键词

引用

@article{arxiv.1811.12583,
  title  = {Rethinking clinical prediction: Why machine learning must consider year of care and feature aggregation},
  author = {Bret Nestor and Matthew B. A. McDermott and Geeticka Chauhan and Tristan Naumann and Michael C. Hughes and Anna Goldenberg and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:1811.12583},
  year   = {2018}
}

备注

Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216