中文

合成电子健康记录的评估

机器学习 2022-10-18 v1 人工智能

摘要

生成模型因其捕捉复杂底层数据分布的能力,已被证明在数据合成方面行之有效。这些模型生成数据的质量通常通过图像数据集的视觉检查或表格数据集的下游分析任务来评估。这些评估方法既未度量隐式数据分布,也未考虑数据隐私问题,如何比较和排序不同生成模型仍是一个开放性问题。医疗数据可能具有敏感性,因此在保持合成数据集数据效用的同时,关注患者隐私至关重要。除效用评估外,本工作提出了称为相似度(Similarity)和独特性(Uniqueness)的两个度量,用于合成数据集的样本级评估。我们利用若干最先进(state-of-the-art)的生成模型合成囊性纤维化(Cystic Fibrosis, CF)患者的电子健康记录(EHRs),展示了所提出的度量适用于合成数据评估和生成模型比较。

关键词

引用

@article{arxiv.2210.08655,
  title  = {Evaluation of the Synthetic Electronic Health Records},
  author = {Emily Muller and Xu Zheng and Jer Hayes},
  journal= {arXiv preprint arXiv:2210.08655},
  year   = {2022}
}

备注

arXiv admin note: substantial text overlap with arXiv:2201.05400