关于 Bagging 的固有差分隐私性
密码学与安全
2020-08-25 v1 机器学习
摘要
差分隐私机器学习在保护敏感训练数据隐私的同时训练模型。获得差分隐私模型的关键在于向训练过程引入噪声/随机性。特别地,现有的差分隐私机器学习方法向训练数据、梯度、损失函数和/或模型本身添加噪声。Bagging 是一种流行的集成学习框架,它随机创建训练数据的一些子样本,使用基学习器为每个子样本训练一个基模型,并在预测时取基模型的多数投票。Bagging 在训练过程中因随机创建子样本而具有固有随机性。我们的主要理论结果表明,这种固有随机性已使 Bagging 无需额外噪声即实现差分隐私。具体而言,我们证明对于任意基学习器,有放回与无放回的 Bagging 分别实现 -差分隐私与 -差分隐私,其中 为训练数据规模, 为子样本规模, 为基模型数量。此外,我们证明若不对基学习器作任何假设,我们所推导的隐私保证是紧的。我们在 MNIST 与 CIFAR10 上对 Bagging 进行了实证评估。实验结果表明,在相同隐私预算下,Bagging 比最先进(SOTA)的差分隐私机器学习方法取得了显著更高的准确率。
引用
@article{arxiv.2008.09845,
title = {On the Intrinsic Differential Privacy of Bagging},
author = {Hongbin Liu and Jinyuan Jia and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:2008.09845},
year = {2020}
}