利用垂直公私分割提升合成数据生成效果
机器学习
2025-04-16 v1 密码学与安全
摘要
差分隐私合成数据生成(Differentially Private Synthetic Data Generation, DP-SDG)是私有安全表格数据共享的关键技术,通过添加精心校准的统计噪声来保证个人隐私,同时保留输入数据的统计特性。近期文献探索了利用少量公共数据来提高合成数据质量的方法,这些方法研究的是水平公私划分,假设可获取少量公共行用于模型初始化,从而提供有限的实用性提升。然而,现实数据集往往自然地由公共属性和私有属性构成,使得垂直公私划分在实际合成数据部署中更为 Relevant。我们提出了一种新框架,将水平公私方法适用于垂直设置进行比较。我们还提供了另一种基于条件生成的替代方法,揭示了公共数据辅助方法的初始局限性,并提出了未来研究方向以解决这些挑战。
引用
@article{arxiv.2504.10987,
title = {Leveraging Vertical Public-Private Split for Improved Synthetic Data Generation},
author = {Samuel Maddock and Shripad Gade and Graham Cormode and Will Bullock},
journal= {arXiv preprint arXiv:2504.10987},
year = {2025}
}
备注
Accepted to the Synthetic Data x Data Access Problem (SynthData) workshop @ ICLR 2025