中文

关注性能差距:审视前瞻性验证中的数据集偏移

计算机与社会 2021-07-30 v1 机器学习

摘要

一旦整合入临床诊疗,患者风险分层模型的表现可能劣于其回顾性表现。迄今广泛认为,由于诊疗流程和患者人群的变化,性能会随时间退化。然而,此种现象发生的程度尚不清楚,部分原因在于极少有研究者报告前瞻性验证性能。本研究中,我们将一个用于预测医疗相关感染的患者风险分层模型在 2020–2021('20–'21)的前瞻性表现,与同一模型在 2019–2020('19–'20)的回顾性验证进行比较。我们将回顾性与前瞻性表现之差定义为性能差距。我们估计 i) “时间偏移”,即临床工作流和患者人群的变化,以及 ii) “基础设施偏移”,即数据访问、抽取和转换的变化,二者对性能差距的贡献。该模型在 2020 年 7 月至 2021 年 6 月为期十二个月、前瞻性地应用于 26,864 次医院就诊,取得了受试者工作特征曲线下面积(AUROC)0.767(95% 置信区间(CI):0.737, 0.801)和 Brier 分数 0.189(95% CI:0.186, 0.191)。相较于 '19–'20 回顾性表现(AUROC 0.778(95% CI:0.744, 0.815),Brier 分数 0.163(95% CI:0.161, 0.165)),前瞻性表现略有下降。由此产生的性能差距主要源于基础设施偏移而非时间偏移。只要我们将继续利用大型研究数据仓库中存储的数据开发和验证模型,就必须考虑数据访问方式与时机的差异,衡量这些差异如何影响前瞻性表现,并努力缓解这些差异。

关键词

引用

@article{arxiv.2107.13964,
  title  = {Mind the Performance Gap: Examining Dataset Shift During Prospective Validation},
  author = {Erkin Ötleş and Jeeheh Oh and Benjamin Li and Michelle Bochinski and Hyeon Joo and Justin Ortwine and Erica Shenoy and Laraine Washer and Vincent B. Young and Krishna Rao and Jenna Wiens},
  journal= {arXiv preprint arXiv:2107.13964},
  year   = {2021}
}

备注

Accepted by the 2021 Machine Learning for Healthcare Conference