中文

DataLens:通过梯度压缩与聚合实现可扩展的隐私保护训练

机器学习 2022-03-29 v6 密码学与安全

摘要

深度神经网络(DNNs)近期的成功依赖于大规模数据集的可用性;然而,在此类数据集上训练往往对敏感训练信息带来隐私风险。在本文中,我们旨在探索生成模型与梯度稀疏性的能力,并提出一种可扩展的隐私保护生成模型 DATALENS。与允许教师对一维预测进行投票的标准 PATE 隐私保护框架相比,在高维梯度向量上投票在隐私保护方面具有挑战性。由于需要降维技术,我们必须在(1)隐私保护的提升与(2)SGD 收敛的放缓之间 navigating 一个微妙的权衡空间。为此,我们利用通信高效学习,提出一种新颖的噪声压缩与聚合方法 TOPAGG,将用于降维的 top-k 压缩与相应的噪声注入机制相结合。我们从理论上证明 DATALENS 框架为其生成的数据提供了差分隐私保证,并提供了其收敛性分析。为展示 DATALENS 的实际使用,我们在包括 MNIST、Fashion-MNIST 和高维 CelebA 在内的多样数据集上进行了广泛实验,结果表明 DATALENS 显著优于其他基线 DP 生成模型。此外,我们将 DATALENS 中的关键构建模块之一 TOPAGG 方法适配到 DP SGD 训练中,并表明其在大多数情况下能够比最先进的 DP SGD 方法获得更高的效用。我们的代码公开于 https://github.com/AI-secure/DataLens。

关键词

引用

@article{arxiv.2103.11109,
  title  = {DataLens: Scalable Privacy Preserving Training via Gradient Compression and Aggregation},
  author = {Boxin Wang and Fan Wu and Yunhui Long and Luka Rimanic and Ce Zhang and Bo Li},
  journal= {arXiv preprint arXiv:2103.11109},
  year   = {2022}
}

备注

Accepted to ACM CCS 2021. 23 pages, 4 figures, 12 tables