深度生成模型生成的合成数据的去偏
机器学习
2025-01-16 v2 机器学习
摘要
虽然合成数据在隐私保护方面前景广阔,但其统计分析带来了重大挑战,需要创新性的解决方案。利用深度生成模型(DGMs)进行合成数据生成已知会引入显著的偏差和不精确性,损害其推理效用,区别于原始数据分析。这种偏差和不确定性可能大到足以阻碍统计收敛速率,即使是在均值计算等看似简单的分析中。此类估计量的标准误差随样本量的收缩速度慢于典型的 速率。这使基本计算如 值和置信区间变得复杂,目前尚无直接的补救方法。针对这些挑战,我们提出了一种针对 DGMs 为特定数据分析生成的合成数据的新策略。从去偏和靶向机器学习中汲取见解,我们的方法考虑了偏差、提升了收敛速率,并促进了具有易近似大样本方差的估计量的计算。我们通过玩具数据的模拟研究和两个真实世界数据的案例研究来说明我们的提议,突出了为靶向数据分析定制 DGMs 的重要性。这一去偏策略有助于推进合成数据在统计推断中的可靠性和适用性。
引用
@article{arxiv.2411.04216,
title = {Debiasing Synthetic Data Generated by Deep Generative Models},
author = {Alexander Decruyenaere and Heidelinde Dehaene and Paloma Rabaey and Christiaan Polet and Johan Decruyenaere and Thomas Demeester and Stijn Vansteelandt},
journal= {arXiv preprint arXiv:2411.04216},
year = {2025}
}
备注
Accepted for the 38th Conference on Neural Information Processing Systems (NeurIPS 2024), joint first authors