评估医学数据集中模型性能随时间的变化
机器学习
2023-07-21 v2 人工智能
摘要
部署于医疗系统中的机器学习 (ML) 模型必须面对来自持续演化环境的数据。然而,提出此类模型的研究者通常以与时间无关的方式评估它们,即根据整个研究时间段内随机抽样的患者来划分数据集。本文提出医学数据集随时间评估 (EMDOT) 框架,用于跨时间评估一类模型的性能。受回测概念启发,EMDOT 模拟从业者在每个时间点可能执行的训练过程,并在所有未来时间点评估所得模型。在六个不同医学数据源(表格与影像)上评估线性和更复杂的模型,我们展示了依数据集不同,使用全部历史数据在许多情况下可能是理想的,而使用最近数据的窗口在其他情况下可能更有利。在模型遭遇性能突然退化的数据集中,我们调查了这些冲击的可能解释。我们发布了 EMDOT 软件包,以助推动面向部署的随时间评估的进一步工作。
引用
@article{arxiv.2305.13426,
title = {Evaluating Model Performance in Medical Datasets Over Time},
author = {Helen Zhou and Yuwen Chen and Zachary C. Lipton},
journal= {arXiv preprint arXiv:2305.13426},
year = {2023}
}
备注
To appear at Conference on Health, Inference, and Learning (CHIL) 2023. arXiv admin note: substantial text overlap with arXiv:2211.07165