中文

面向隐私保护去中心化数据集有效机器学习的生成模型

机器学习 2020-02-06 v2 机器学习

摘要

为改进机器学习的实际应用,有经验的建模者会培养关于其数据集、模型及二者相互作用的直觉。对原始数据的手动检查——代表性样本、离群值、误分类——是以下方面的关键工具:a) 识别并修复数据中的问题,b) 生成新的建模假设,c) 分配或精炼人工提供的标签。然而,对于隐私敏感数据集(如代表真实世界个体行为的数据),手动检查数据是有问题的。此外,在日益重要的联邦学习场景中,原始样本存储于边缘端,建模者仅能访问聚合输出(如指标或模型参数),手动数据检查是不可能的。本文证明,使用联邦方法训练且具有形式化差分隐私保证的生成模型,即使在数据无法直接检查的情况下,也能有效调试许多常见数据问题。我们在文本应用(使用差分隐私联邦 RNN)和图像应用(使用一种新颖的差分隐私联邦 GAN 算法)中探索了这些方法。

关键词

引用

@article{arxiv.1911.06679,
  title  = {Generative Models for Effective ML on Private, Decentralized Datasets},
  author = {Sean Augenstein and H. Brendan McMahan and Daniel Ramage and Swaroop Ramaswamy and Peter Kairouz and Mingqing Chen and Rajiv Mathews and Blaise Aguera y Arcas},
  journal= {arXiv preprint arXiv:1911.06679},
  year   = {2020}
}

备注

26 pages, 8 figures. Camera-ready ICLR 2020 version