基于肺瘤作为例的从真实人群数据中自动提取生成合成患者数据的规则
机器学习
2025-12-19 v2
摘要
生成合成数据的技术正在成为以隐私合规方式使医疗数据可用于二次使用的热门方法。基于条件发生概率(如疾病)的因素(如年龄)来描述的规则是创建逼真患者数据的流行方法。Synthea数据生成器基于描述合成患者一生的规则生成数据。由于这些规则仅包含统计信息,通常不包含特定的数据保护要求。然而,创建有意义的规则是一个非常复杂的过程,需要专家知识和真实样本数据。本文我们引入并评估了一种从表格数据统计信息中自动生成Synthea规则的方法,这些数据我们从癌症报告中提取。作为示例用例,我们为肳瘤创建了一个Synthea模块,并使用其生成合成数据集。与原始数据集相比,合成数据再现了已知的疾病进程,主要保留了统计特性。总体而言,合成患者数据在隐私保护研究中具有巨大潜力。该数据可用于提出假设和开发原型,但医学解释应考虑其作为当前方法的特定局限性。
引用
@article{arxiv.2512.14721,
title = {Automatic Extraction of Rules for Generating Synthetic Patient Data From Real-World Population Data Using Glioblastoma as an Example},
author = {Arno Appenzeller and Nick Terzer and André Homeyer and Jan-Philipp Redlich and Sabine Luttmann and Friedrich Feuerhake and Nadine S. Schaadt and Timm Intemann and Sarah Teuber-Hanselmann and Stefan Nikolin and Joachim Weis and Klaus Kraywinkel and Pascal Birnstill},
journal= {arXiv preprint arXiv:2512.14721},
year = {2025}
}
备注
16 pages, 8 figures