MIMIC-Extract:面向 MIMIC-III 的数据提取、预处理与表示流水线
机器学习
2020-08-20 v2 机器学习
摘要
稳健的机器学习依赖于能够用于重要任务中标准化框架的数据,以及开发性能可被合理复现的模型的能力。在医疗机器学习中,由于缺少公开可获取的数据与标准化的数据处理框架,社区面临可复现性挑战。我们提出 MIMIC-Extract,一个开源流水线,用于将公开可用的 MIMIC-III 数据库中危重患者的原始电子健康记录(EHR)数据转换为可直接用于常见机器学习流水线的数据框。MIMIC-Extract 解决了使复杂健康记录数据对更广泛机器学习社区可获取的三个主要挑战。首先,它提供标准化的数据处理函数,包括单位转换、离群值检测以及聚合语义等价特征,从而处理重复并减少缺失。其次,它保留临床数据的时间序列性质,并可轻松集成到医疗机器学习中的临床可操作预测任务中。最后,它高度可扩展,以便具有相关问题其他研究者可轻松使用该同一流水线。我们通过展示若干基准任务与基线结果来演示该流水线的效用。
引用
@article{arxiv.1907.08322,
title = {MIMIC-Extract: A Data Extraction, Preprocessing, and Representation Pipeline for MIMIC-III},
author = {Shirly Wang and Matthew B. A. McDermott and Geeticka Chauhan and Michael C. Hughes and Tristan Naumann and Marzyeh Ghassemi},
journal= {arXiv preprint arXiv:1907.08322},
year = {2020}
}