MEDS-Tab:MEDS数据集的自动化表格化与基线方法
机器学习
2024-11-04 v1
摘要
为结构化电子健康记录(EHR)数据的有效、可靠和可扩展的机器学习(ML)解决方案开发,需要能够以高效且高性能的方式可靠地生成针对多样化监督学习任务的高质量基线模型。历史上,生成此类基线模型在很大程度上是一项人工劳动——研究人员需要决定应用于其各自原始纵向数据的特定特征化和表格化过程;然后在这些数据上训练监督模型以产生基线结果供新方法对比,而且仅针对一个任务和一个数据集。在本研究中,得益于MEDS框架在核心数据标准化方面的互补进展,我们极大地简化并加速了将不规则采样时间序列数据表格化的过程,为研究人员提供了自动且可扩展地特征化和表格化纵向EHR数据的能力,涵盖数万个体特征、数亿临床事件以及多样化的窗口范围和聚合策略,最终利用这些表格数据以高度计算效率的方式自动生成高质量的XGBoost基线。该系统可扩展至比当前社区可用的表格化工具大得多的数据集,使任何MEDS格式数据集的研究人员能够立即开始在各种任务上生成可靠且高性能的基线预测结果,且所需人工干预极少。该系统将极大地提升针对多样化数据集和临床环境中的健康问题开发强大ML解决方案的可靠性、可复现性和易用性。
引用
@article{arxiv.2411.00200,
title = {MEDS-Tab: Automated tabularization and baseline methods for MEDS datasets},
author = {Nassim Oufattole and Teya Bergamaschi and Aleksia Kolo and Hyewon Jeong and Hanna Gaggin and Collin M. Stultz and Matthew B. A. McDermott},
journal= {arXiv preprint arXiv:2411.00200},
year = {2024}
}