CRITICAL Records Integrated Standardization Pipeline (CRISP):大规模多机构 OMOP CDM 数据的端到端处理
机器学习
2025-09-24 v2
摘要
虽然现存的重症监护 EHR 数据集如 MIMIC 和 eICU 已为临床人工智能研究带来了显著进展,但 CRITICAL 数据集开辟了新的前沿,其独特优势在于提供了广泛的规模与多样性——涵盖 371,365 名患者、195 亿条记录,来自四个地理分布广泛的 CTSA 机构。CRITICAL 的独特亮点在于捕获患者完整的旅程,包括住院前、ICU、住院后及门诊等各阶段就诊。这种多机构、纵向视角为开发可泛化的预测模型和推进健康公平研究创造了变革性的机遇。然而,这种多站点的资源的丰富性引入了在数据标准化方面巨大的复杂性,不同机构的收集实践和多样化的词汇使用模式需要 sophisticated 的预处理方法。我们提出了 CRISP 以发掘这一宝贵资源的全部潜能。CRISP 通过以下方式将原始 Observational Medical Outcomes Partnership Common Data Model 数据系统地转化为 ML-就绪数据集:(1) 透明的数据质量管理,包含全面的审计痕迹;(2) 将异构医学术语映射到统一的 SNOMED-CT 标准,包括去重和单位标准化;(3) 模块化架构,支持并行优化,使即使在标准计算硬件上也能在 1 天内完成整个数据集的处理;(4) 综合的基准模型测试,涵盖多种临床预测任务,以建立可复现的性能标准。通过提供处理管道、基线实现以及详细的转换文档,CRISP 为研究人员节省了数月的预处理工作, democratizes 了对大规模多机构重症护理数据的获取,使他们能够专注于推进临床人工智能的发展。
关键词
引用
@article{arxiv.2509.08247,
title = {The CRITICAL Records Integrated Standardization Pipeline (CRISP): End-to-End Processing of Large-scale Multi-institutional OMOP CDM Data},
author = {Xiaolong Luo and Michael Lingzhi Li},
journal= {arXiv preprint arXiv:2509.08247},
year = {2025}
}
备注
15 pages, 9 figures