刻画私有学习者的样本复杂度
密码学与安全
2014-02-12 v1 机器学习
摘要
2008 年,Kasiviswanathan 等人将私有学习定义为 PAC 学习与差分隐私的结合。非正式地说,私有学习者应用于带标签的个体信息集合,并在输出假设的同时保护每个个体的隐私。Kasiviswanathan 等人给出了针对(有限)概念类的私有学习者的通用构造,其样本复杂度关于概念类的大小呈对数级。该样本复杂度高于非私有学习者所需,因此留下了私有学习的样本复杂度有时可能显著高于非私有学习的可能性。我们给出了私有学习一个概念类所需充分且必要的样本大小的组合刻画。此刻画类似于著名的基于概念类 VC 维度的非私有学习样本复杂度刻画。我们引入了概念类的概率表示概念,我们的新复杂度度量 RepDim 对应于概念类最小概率表示的大小。我们表明,任何样本复杂度为 m 的概念类 C 的私有学习算法都意味着 RepDim(C)=O(m),并且存在样本复杂度为 m=O(RepDim(C)) 的私有学习算法。我们进一步证明,类似的刻画也适用于私有计算一大类优化问题所需的数据库大小,以及广受关注的私有数据发布问题。
引用
@article{arxiv.1402.2224,
title = {Characterizing the Sample Complexity of Private Learners},
author = {Amos Beimel and Kobbi Nissim and Uri Stemmer},
journal= {arXiv preprint arXiv:1402.2224},
year = {2014}
}