生成合成但可信的医疗记录数据集
机器学习
2018-07-05 v1 机器学习
摘要
生成“看起来像”给定真实数据集的数据集,对于机器学习的医疗应用以及许多其他科学与工程领域而言是一项有趣的任务。本文提出一种基于潜变量矩参数学习方法的新方法,该方法可普遍应用于二元数据集,我们此前已将其用于患者数据集的聚类。我们将本方法与近期基于生成对抗方法的 MedGan 方案进行比较,发现我们所生成的合成数据集至少在两方面整体上更为真实:随机森林与 MMD 统计量更难区分真实与合成实例。最可能的解释是我们的方法不会遭受 GAN 所公认的“模式崩溃”问题。此外,我们生成的生成模型易于解释,不像相当晦涩的 GAN。我们的实验在两个包含 ICD-9 诊断码的患者数据集上进行:公开可用的 MIMIC-III 数据集,以及巴塞罗那 Hospital de Sant Pau 医院 7 年间充血性心力衰竭入院数据集。
引用
@article{arxiv.1807.01514,
title = {Generating Synthetic but Plausible Healthcare Record Datasets},
author = {Laura Aviñó and Matteo Ruffini and Ricard Gavaldà},
journal= {arXiv preprint arXiv:1807.01514},
year = {2018}
}
备注
MLMH 2018 : 2018 KDD workshop on Machine Learning for Medicine and Healthcare