中文

借助公共数据的私有学习极限

机器学习 2019-10-28 v1 密码学与安全 机器学习

摘要

我们考虑一类训练集由两类样本——私有样本与公共样本——组成的学习问题。目标是设计一种仅针对私有样本满足差分隐私的学习算法。该设定介于私有学习(所有样本均私有)与经典学习(所有样本均公共)之间。我们从私有样本复杂度与公共样本复杂度两方面研究该设定下的学习极限。我们证明,任何 VC 维为 dd 的假设类均可被不可知地学习至超出误差 α\alpha,仅使用(大致)d/αd/\alpha 个公共样本与 d/α2d/\alpha^2 个私有标注样本。即便公共样本无标注,该结果仍成立。这相对于公共样本复杂度的标准上界 d/α2d/\alpha^2(若公共样本有标注则可完全忽略私有样本)给出了二次改进。此外,我们给出了近乎匹配的下界,并通过从该设定到无公共数据的私有学习设定的一般化归约予以证明。

关键词

引用

@article{arxiv.1910.11519,
  title  = {Limits of Private Learning with Access to Public Data},
  author = {Noga Alon and Raef Bassily and Shay Moran},
  journal= {arXiv preprint arXiv:1910.11519},
  year   = {2019}
}