公共数据辅助的镜面下降法用于私有模型训练
机器学习
2022-03-29 v2 密码学与安全
摘要
在本文中,我们重新审视了利用同分布公共数据来改善差分隐私(DP)模型训练中隐私/效用权衡的问题。(此处,公共数据指无隐私顾虑的辅助数据集。)我们设计了一种自然的 DP 镜面下降变体,其中私有/敏感数据的 DP 梯度作为线性项,而公共数据产生的损失作为镜面映射。我们证明,对于特征向量取自非各向同性亚高斯分布的线性回归,当公共数据样本数()足够大时,我们的算法 PDA-DPMD(镜面下降的一种变体)所提供的总体风险保证在渐近上优于已知最好的无公共数据 DP 保证。我们进一步表明,我们的算法具有自然的“噪声稳定性”性质,可控制为保证 DP 而添加噪声所引起的方差。我们通过在四个基准数据集(StackOverflow、WikiText-2、CIFAR-10 和 EMNIST)上展示隐私/效用权衡,证明了我们算法的有效性。我们表明,我们的算法不仅显著优于无法访问公共数据的传统 DP-SGD,而且据我们所知,是首个在经公共数据预训练的模型上优于 DP-SGD 的算法。
引用
@article{arxiv.2112.00193,
title = {Public Data-Assisted Mirror Descent for Private Model Training},
author = {Ehsan Amid and Arun Ganesh and Rajiv Mathews and Swaroop Ramaswamy and Shuang Song and Thomas Steinke and Vinith M. Suriyakumar and Om Thakkar and Abhradeep Thakurta},
journal= {arXiv preprint arXiv:2112.00193},
year = {2022}
}
备注
20 pages, 8 figures, 3 tables