释放随机化在差分隐私机器学习审计中的力量
机器学习
2023-05-31 v1 密码学与安全
信息论
math.IT
统计理论
统计理论
摘要
我们提出了一种严谨的方法,通过添加多个精心设计的称为 canaries(金丝雀样本)的示例来审计差分隐私机器学习算法。我们采用基于三个关键组件的第一性原理方法。首先,我们引入提升差分隐私(Lifted Differential Privacy, LiDP),将差分隐私的定义扩展为处理随机化数据集。这使我们能够自由设计随机化 canaries。其次,我们通过尝试区分在数据集上使用 个 canaries 训练与使用 个 canaries 训练(留出一个 canary)的模型来审计 LiDP。通过独立同分布地抽取 canaries,LiDP 可利用设计中的对称性,并重用每个私有训练模型来运行多个统计检验,每个 canary 对应一个。第三,我们引入新颖的置信区间,通过适应经验高阶相关性来利用多个检验统计量。总体而言,这一新方案在理论和实证上均使用合成和真实数据展示了样本复杂度的显著提升。此外,近期设计更强 canaries 的进展可轻易纳入新框架。
引用
@article{arxiv.2305.18447,
title = {Unleashing the Power of Randomization in Auditing Differentially Private ML},
author = {Krishna Pillutla and Galen Andrew and Peter Kairouz and H. Brendan McMahan and Alina Oprea and Sewoong Oh},
journal= {arXiv preprint arXiv:2305.18447},
year = {2023}
}