中文

公共数据辅助的镜面下降法用于私有模型训练

机器学习 2022-03-29 v2 密码学与安全

摘要

在本文中,我们重新审视了利用同分布公共数据来改善差分隐私(DP)模型训练中隐私/效用权衡的问题。(此处,公共数据指无隐私顾虑的辅助数据集。)我们设计了一种自然的 DP 镜面下降变体,其中私有/敏感数据的 DP 梯度作为线性项,而公共数据产生的损失作为镜面映射。我们证明,对于特征向量取自非各向同性亚高斯分布的线性回归,当公共数据样本数(npubn_{\sf pub})足够大时,我们的算法 PDA-DPMD(镜面下降的一种变体)所提供的总体风险保证在渐近上优于已知最好的无公共数据 DP 保证。我们进一步表明,我们的算法具有自然的“噪声稳定性”性质,可控制为保证 DP 而添加噪声所引起的方差。我们通过在四个基准数据集(StackOverflow、WikiText-2、CIFAR-10 和 EMNIST)上展示隐私/效用权衡,证明了我们算法的有效性。我们表明,我们的算法不仅显著优于无法访问公共数据的传统 DP-SGD,而且据我们所知,是首个在经公共数据预训练的模型上优于 DP-SGD 的算法。

关键词

引用

@article{arxiv.2112.00193,
  title  = {Public Data-Assisted Mirror Descent for Private Model Training},
  author = {Ehsan Amid and Arun Ganesh and Rajiv Mathews and Swaroop Ramaswamy and Shuang Song and Thomas Steinke and Vinith M. Suriyakumar and Om Thakkar and Abhradeep Thakurta},
  journal= {arXiv preprint arXiv:2112.00193},
  year   = {2022}
}

备注

20 pages, 8 figures, 3 tables