中文

面向更好死亡预测的亚群体特定合成电子健康记录

机器学习 2024-03-12 v2

摘要

电子健康记录(EHR)通常包含某些亚群体(SP)不同的代表率。患者人口统计学特征、临床病症患病率和医疗中心类型等因素导致了这种代表性不足。因此,在此类数据集上训练机器学习模型时,模型难以良好泛化,且在代表性不足的SP上表现不佳。为解决此问题,我们提出一种利用生成模型的新型集成框架。具体而言,我们为每个SP训练一个基于GAN的合成数据生成器,并将合成样本纳入每个SP的训练集。最终,我们训练SP特定的预测模型。为恰当评估该方法,我们设计了一个包含2个真实世界用例数据集的评估流程,这些数据集查询自MIMIC数据库。我们的方法在代表性不足的SP上显示出模型性能的提升。我们的代码和模型作为补充材料提供,并将在公共仓库中发布。

关键词

引用

@article{arxiv.2305.16363,
  title  = {Subpopulation-Specific Synthetic EHR for Better Mortality Prediction},
  author = {Oriel Perets and Nadav Rappoport},
  journal= {arXiv preprint arXiv:2305.16363},
  year   = {2024}
}

备注

10 pages, 4 figures, submitted to AIME 2024