中文

生成具有用户定制能力的私有数据

信号处理 2020-12-04 v1 机器学习

摘要

手机等个人设备可产生并存储大量能提升机器学习模型的数据;然而,这些数据可能包含数据所有者特有的私有信息,从而阻碍数据发布。我们希望在保留有用信息的同时,降低用户特定私有信息与数据之间的相关性。我们并非训练一个大型模型端到端地实现私有化,而是先解耦潜在表示的创建,再对数据进行私有化,使得用户特定的私有化能在计算受限且对数据效用扰动最小的环境下完成。我们利用变分自编码器(VAE)创建数据的紧凑潜在表示,该表示对所有设备及所有可能的私有标签保持固定。随后我们训练一个小型生成滤波器,根据用户关于私有信息与效用信息的指定偏好来扰动该潜在表示。该小型滤波器通过GAN型鲁棒优化进行训练,可在手机或平板等分布式设备上完成。在我们线性滤波器的特殊条件下,我们揭示了生成方法与Rényi差分隐私之间的联系。我们在包括MNIST、UCI-Adult和CelebA的多个数据集上开展实验,并给出包含潜在嵌入几何可视化及经验互信息估计的详尽评估,以证明方法的有效性。

关键词

引用

@article{arxiv.2012.01467,
  title  = {Generating private data with user customization},
  author = {Xiao Chen and Thomas Navidi and Ram Rajagopal},
  journal= {arXiv preprint arXiv:2012.01467},
  year   = {2020}
}

备注

arXiv admin note: substantial text overlap with arXiv:1904.09415