噪声随机梯度下降的隐私性:更多迭代而无更多隐私损失
机器学习
2023-03-01 v2 密码学与安全
最优化与控制
机器学习
摘要
机器学习中的一个核心问题是如何在敏感用户数据上训练模型。工业界已广泛采用一种简单算法:带噪声的随机梯度下降(亦称随机梯度朗之万动力学)。然而,关于该算法隐私损失的基础理论问题仍然开放——即便在看似简单的有界域上平滑凸损失设定下也是如此。我们的主要结果解决了这些问题:对于大范围参数,我们刻画了差分隐私至常数因子。该结果揭示,此前该设定下的所有分析均具有错误的定性行为。具体而言,先前的隐私分析随迭代次数无限增长,而我们证明在经过短暂预热期后,运行更长时间的 SGD 不会泄露进一步隐私。我们的分析脱离了以往基于快速混合的思路,转而使用基于最优传输(即迭代隐私放大)和采样高斯机制(即采样隐私放大)的技术。我们的技术可轻易推广到其他设定,例如强凸损失、非均匀步长、任意批量大小以及随机或循环选取批量。
引用
@article{arxiv.2205.13710,
title = {Privacy of Noisy Stochastic Gradient Descent: More Iterations without More Privacy Loss},
author = {Jason M. Altschuler and Kunal Talwar},
journal= {arXiv preprint arXiv:2205.13710},
year = {2023}
}
备注
v2: improved exposition, slightly simplified proofs, all results unchanged