面向因果推断的生成合成数据:陷阱、补救与机遇
统计方法学
2026-05-12 v2 人工智能
机器学习
摘要
合成表格数据常通过分布相似性、隐私距离或基于合成数据训练、基于真实数据测试的预测性能进行评估,但这些标准不确保因果推断的有效性。我们展示,完全生成的表格合成器(包括 GAN 和 LLM 模型)可在保持预测实用性的同时扭曲平均处理效应(ATE)估计。这种失效是结构性的:ATE 保存需要同时满足现实的协变量分布和准确的处理效应对比,而预测损失仅通过重叠加权项对处理效应误差进行惩罚。我们通过灵敏度和损失分解结果形式化化解这一矛盾,并在对数损失下的块级下一词预测中识别出类似的分解。受表格因果分析启发,我们提出一种混合合成数据框架,该框架在生成协变量的同时单独建模处理和结果机制,允许面向因果的随机合成分配。我们在三个场景中评估该框架:完全生成与混合合成下的 ATE 保存、针对实际正向性问题的有针对性的数据增强,以及在真实数据分析前用于比较 OR、IPW、AIPW 和 TMLE 的合成仿真引擎。跨越合成数据和 ACTG 实验,混合合成在因果忠诚度方面优于完全生成的基线方法;基于 LLM 的混合合成在 ATE 保存和有限样本估计器基准测试中往往比 CTGAN 更可靠。
引用
@article{arxiv.2604.23904,
title = {Generative Synthetic Data for Causal Inference: Pitfalls, Remedies, and Opportunities},
author = {Yichen Xu},
journal= {arXiv preprint arXiv:2604.23904},
year = {2026}
}