中文

合成电子健康记录生成模型的多面向基准评测

机器学习 2023-01-11 v1 人工智能 计算机与社会

摘要

合成健康数据有潜力在共享数据以支持生物医学研究及创新医疗应用开发时缓解隐私担忧。基于机器学习的现代数据生成方法,尤其是生成对抗网络(GAN)方法,持续发展并展现出显著潜力。然而,缺乏一个系统性评估框架来对新出现的方法进行基准评测,并确定哪些方法最适用于哪些用例。本工作中,我们引入一个可泛化的基准框架,从效用与隐私度量角度评估合成健康数据的关键特征。我们应用该框架,针对来自两个大型学术医疗中心的电子健康记录(EHR)数据,就若干用例评估合成数据生成方法。结果表明,共享合成 EHR 数据存在效用-隐私权衡。结果进一步指出,没有任何方法在每个用例的所有标准上都是 unequivocally 最佳,这清楚地说明了为何合成数据生成方法需在具体情境下评估。

关键词

引用

@article{arxiv.2208.01230,
  title  = {A Multifaceted Benchmarking of Synthetic Electronic Health Record Generation Models},
  author = {Chao Yan and Yao Yan and Zhiyu Wan and Ziqi Zhang and Larsson Omberg and Justin Guinney and Sean D. Mooney and Bradley A. Malin},
  journal= {arXiv preprint arXiv:2208.01230},
  year   = {2023}
}