中文

提高下游医学因果推断的合成数据生成与评估

机器学习 2025-10-22 v1

摘要

因果推断对于开发和评估医学干预至关重要,但由于监管障碍,真实医学数据集往往难以获取。这使得合成数据成为可能的宝贵资产,使医学分析得以实现,以及新推断方法的开发本身。生成模型可以产生接近真实数据分布的合成数据,但现有方法不考虑下游因果推断任务的独特挑战,特别是针对治疗的任务。我们确立了一组期望值,使得包含治疗的合成数据在最大化下游效用方面满足:(i) 保存协变量分布,(ii) 保存治疗分配机制,以及(iii) 保存结果生成机制。基于这些期望值,我们提出了一组评估指标来评估此类合成数据。最后,我们提出了STEAM:一种用于医疗治疗效应分析的合成数据生成方法,该方法模拟包含治疗的数据生成过程,并针对我们的期望值进行优化。我们经验性地演示了STEAM在我们的指标上相对于现有生成模型实现了国际领先的性能,特别是在真实数据生成过程的复杂性增加时。

关键词

引用

@article{arxiv.2510.18768,
  title  = {Improving the Generation and Evaluation of Synthetic Data for Downstream Medical Causal Inference},
  author = {Harry Amad and Zhaozhi Qian and Dennis Frauen and Julianna Piskorz and Stefan Feuerriegel and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2510.18768},
  year   = {2025}
}