中文

关于 Bagging 的固有差分隐私性

密码学与安全 2020-08-25 v1 机器学习

摘要

差分隐私机器学习在保护敏感训练数据隐私的同时训练模型。获得差分隐私模型的关键在于向训练过程引入噪声/随机性。特别地,现有的差分隐私机器学习方法向训练数据、梯度、损失函数和/或模型本身添加噪声。Bagging 是一种流行的集成学习框架,它随机创建训练数据的一些子样本,使用基学习器为每个子样本训练一个基模型,并在预测时取基模型的多数投票。Bagging 在训练过程中因随机创建子样本而具有固有随机性。我们的主要理论结果表明,这种固有随机性已使 Bagging 无需额外噪声即实现差分隐私。具体而言,我们证明对于任意基学习器,有放回与无放回的 Bagging 分别实现 (Nklnn+1n,1(n1n)Nk)\left(N\cdot k \cdot \ln{\frac{n+1}{n}},1- (\frac{n-1}{n})^{N\cdot k}\right)-差分隐私与 (lnn+1n+1Nk,Nkn)\left(\ln{\frac{n+1}{n+1-N\cdot k}}, \frac{N\cdot k}{n} \right)-差分隐私,其中 nn 为训练数据规模,kk 为子样本规模,NN 为基模型数量。此外,我们证明若不对基学习器作任何假设,我们所推导的隐私保证是紧的。我们在 MNIST 与 CIFAR10 上对 Bagging 进行了实证评估。实验结果表明,在相同隐私预算下,Bagging 比最先进(SOTA)的差分隐私机器学习方法取得了显著更高的准确率。

关键词

引用

@article{arxiv.2008.09845,
  title  = {On the Intrinsic Differential Privacy of Bagging},
  author = {Hongbin Liu and Jinyuan Jia and Neil Zhenqiang Gong},
  journal= {arXiv preprint arXiv:2008.09845},
  year   = {2020}
}