中文

生成合成电子健康记录数据:基于表型数据与开源软件的综述与基准测试

机器学习 2025-06-05 v2 人工智能 机器学习

摘要

我们对现有的合成电子健康记录数据生成方法进行了系统性综述,并使用提出的开源软件对主要方法进行了基准测试,以向从业者提供建议。我们搜索了三个学术数据库进行系统性综述。方法在开源 EHR 数据集 MIMIC-III/IV 上进行基准测试。实现了七种涵盖主要类别的方法和两种基线方法并进行比较。评估指标涉及数据保真度、下游效用、隐私保护和计算成本。42 项研究被识别并分为五类。选择了涵盖所有类别的七种开源方法,在 MIMIC-III 上训练,并在 MIMIC-III 或 MIMIC-IV 上进行评估以考虑可迁移性。其中,基于 GAN 的方法在 MIMIC-III 上的保真度和效用方面表现出竞争力;基于规则的方法在隐私保护方面表现出色。在 MIMIC-IV 上也观察到了类似的发现,但基于 GAN 的方法在保持保真度方面进一步优于基线方法。提供了一个名为 "SynthEHRella" 的 Python 包,用于整合各种方法和评估指标的选择,从而实现更流畅地探索和评估多种方法。我们发现方法的选择取决于下游用例中评估指标的相对重要性。我们提供了一个决策树来指导在基准测试方法中进行选择。根据决策树,当训练集和测试集之间存在分布偏移时,基于 GAN 的方法表现优异。否则,CorGAN 和 MedGAN 最适合关联建模和预测建模,分别。未来研究应优先在控制隐私暴露的同时提高合成数据的保真度,并对纵向或条件生成方法进行全面的基准测试。

关键词

引用

@article{arxiv.2411.04281,
  title  = {Generating Synthetic Electronic Health Record Data: a Methodological Scoping Review with Benchmarking on Phenotype Data and Open-Source Software},
  author = {Xingran Chen and Zhenke Wu and Xu Shi and Hyunghoon Cho and Bhramar Mukherjee},
  journal= {arXiv preprint arXiv:2411.04281},
  year   = {2025}
}