具有用户定制功能的隐私保护数据分布式生成
机器学习
2019-04-23 v1 计算机与社会
机器学习
摘要
移动手机等分布式设备可产生并存储大量能提升机器学习模型的数据;然而,这些数据可能包含数据所有者特有的私人信息,从而妨碍数据发布。我们希望在降低用户特定私人信息与数据之间相关性的同时保留有用信息。我们未采用端到端学习大型模型实现隐私化,而是将潜表示的创建与数据隐私化解耦,使基于用户特定的隐私化能在分布式环境下以有限计算和对数据效用极小干扰的方式实现。我们利用变分自编码器(VAE)创建数据的紧凑潜表示;但该 VAE 对所有设备及所有可能的私有标签保持固定。随后我们训练一个小型生成滤波器,基于个体对私有信息与效用信息的偏好扰动潜表示。该小型滤波器通过可利用 GAN 型鲁棒优化在分布式设备上训练。我们在三个流行数据集 MNIST、UCI-Adult 和 CelebA 上实验,并给出包括潜嵌入几何可视化与经验互信息估计在内的详尽评估,以展示方法有效性。
引用
@article{arxiv.1904.09415,
title = {Distributed generation of privacy preserving data with user customization},
author = {Xiao Chen and Thomas Navidi and Stefano Ermon and Ram Rajagopal},
journal= {arXiv preprint arXiv:1904.09415},
year = {2019}
}
备注
accepted in ICLR 2019 SafeML workshop