中文

联合选择:将公共信息自适应地纳入私有合成数据

机器学习 2024-03-13 v1 人工智能

摘要

基于边缘分布和图模型生成差分隐私合成数据的机制在广泛场景中取得了成功。然而,这些方法的一个局限是无法纳入公共数据。通过在公共数据上预训练来初始化数据生成模型已被证明可以提高合成数据的质量,但当模型结构未预先确定时,该技术并不适用。我们开发了机制 jam-pgm,它扩展了自适应测量框架,以联合选择测量公共数据和私有数据。该技术允许将公共数据纳入基于图模型的机制中。我们表明,即使公共数据分布存在偏差,jam-pgm 也能优于有公共数据辅助和无公共数据辅助的合成数据生成机制。

关键词

引用

@article{arxiv.2403.07797,
  title  = {Joint Selection: Adaptively Incorporating Public Information for Private Synthetic Data},
  author = {Miguel Fuentes and Brett Mullins and Ryan McKenna and Gerome Miklau and Daniel Sheldon},
  journal= {arXiv preprint arXiv:2403.07797},
  year   = {2024}
}