中文

合成数据能否复现流行病学真实研究发现?基于对抗随机森林的复制研究

定量方法 2026-05-06 v3 人工智能 机器学习 应用统计 机器学习

摘要

合成数据在应对流行病学中数据访问受限和隐私问题方面具有巨大潜力。然而,许多现有方法存在质量有限、计算需求高以及对非专业人士复杂等问题。此外,合成数据的常见评估策略往往无法直接反映统计效用,且对隐私风险的衡量也不充分。在此背景下,一个关键但尚未充分探索的问题是:合成数据能否在保护隐私的前提下可靠地复现流行病学研究的关键发现?我们提出对抗随机森林(ARF)作为一种高效且便捷的表格流行病数据合成方法。为评估其性能,我们复制了六项流行病学出版物中的统计分析,涵盖血压、人体测量、心肌梗死、加速测量、孤独感和糖尿病,数据来源包括德国国家队列(NAKO Gesundheitsstudie)、不来梅 STEMI 注册表 U45 研究以及圭尔夫家庭健康研究。我们进一步评估了数据集维度和变量复杂度如何影响合成数据质量,并通过与常用表格数据合成器在效用、隐私、泛化性和运行时间方面的比较来 contextualize ARF 的性能。在所有复制的研究中,ARF 生成的合成数据结果始终与原始发现保持一致。即使在样本量与维度比相对较低的数据集中,描述性和推断性分析的复制结果也与原始结果高度吻合。降低维度和变量复杂度进一步提升了合成质量。ARF 在效用、隐私保护和泛化性方面相对于其他合成器表现优异,且计算效率更高。

关键词

引用

@article{arxiv.2508.14936,
  title  = {Can synthetic data reproduce real-world findings in epidemiology? A replication study using adversarial random forests},
  author = {Jan Kapar and Kathrin Günther and Lori Ann Vallis and Klaus Berger and Nadine Binder and Hermann Brenner and Stefanie Castell and Beate Fischer and Volker Harth and Bernd Holleczek and Timm Intemann and Till Ittermann and André Karch and Thomas Keil and Lilian Krist and Berit Lange and Michael F. Leitzmann and Katharina Nimptsch and Nadia Obi and Iris Pigeot and Tobias Pischon and Tamara Schikowski and Börge Schmidt and Carsten Oliver Schmidt and Anja M. Sedlmair and Justine Tanoey and Harm Wienbergen and Andreas Wienke and Claudia Wigmann and Marvin N. Wright},
  journal= {arXiv preprint arXiv:2508.14936},
  year   = {2026}
}