两阶段数据合成:隐私与预测之间受统计驱动的受限权衡
机器学习
2026-02-10 v1 统计方法学
摘要
合成数据在各个领域日益受到关注,人们越来越强调其在下游预测任务中的性能。然而,大多数现有的合成策略侧重于维持统计信息。尽管一些研究涉及预测性能保证,但其单阶段合成设计使得在需要显著扰动的隐私要求与对此类扰动敏感的预测性能之间取得平衡变得具有挑战性。我们提出了一种两阶段合成策略。在第一阶段,我们引入了一种“先合成后混合”策略,包括生成纯合成数据的合成操作,以及随后将合成数据与原始数据融合的混合操作。在第二阶段,我们提出了一种基于核岭回归的合成策略,其中首先在原始数据上训练一个核岭回归模型,然后利用该模型基于第一阶段生成的合成输入生成合成输出。通过利用核岭回归的理论优势以及第一阶段实现的协变分布保持,我们提出的两阶段合成策略实现了受统计驱动的受限隐私-预测权衡,并保证了最优的预测性能。我们在理论上和数值上验证了我们的方法,并展示了其受统计驱动和受限实现隐私-预测权衡的特性。此外,通过将其应用于一个营销问题和五个真实世界数据集,我们展示了其泛化能力。
引用
@article{arxiv.2602.08657,
title = {Two-Stage Data Synthesization: A Statistics-Driven Restricted Trade-off between Privacy and Prediction},
author = {Xiaotong Liu and Shao-Bo Lin and Jun Fan and Ding-Xuan Zhou},
journal= {arXiv preprint arXiv:2602.08657},
year = {2026}
}