关于 SGD 内在隐私的实证研究
机器学习
2022-03-01 v4 密码学与安全
机器学习
摘要
在机器学习系统的训练中加入噪声是通过差分隐私保证保护个体隐私的一种有力方式,但会以效用为代价。本工作考察随机梯度下降(SGD)的固有随机性是否有助于隐私,从而有效减少实现给定隐私保证所需的额外噪声量。我们进行了一项大规模实证研究来检验这一问题。我们在四个数据集(表格和图像)上针对凸和非凸目标训练了超过 120,000 个模型的网格,证明随机种子对模型权重的影响大于任何单个训练样本。我们测试了由种子诱导的权重分布,发现简单的凸情况可以用多元高斯后验建模,而神经网络表现出多模态和非高斯的权重分布。通过将凸 SGD 视为高斯机制,我们随后估计了一个“内在的”数据依赖的 ε_i(D),发现值低至 6.3,使用经验估计可降至 1.9。我们使用成员推断攻击来估计非凸 SGD 的 ε,并证明对对手隐藏随机种子会导致攻击性能在统计上显著降低,对应于有效 ε 的减少。这些结果提供了经验证据,表明 SGD 相对于其数据集敏感性表现出可观的变异性,并且这种“内在噪声”有潜力被利用来改善隐私保护机器学习的效用。
引用
@article{arxiv.1912.02919,
title = {An Empirical Study on the Intrinsic Privacy of SGD},
author = {Stephanie L. Hyland and Shruti Tople},
journal= {arXiv preprint arXiv:1912.02919},
year = {2022}
}
备注
21 pages, 11 figures, 8 tables