子采样并非魔法:为何大批量尺寸对差分隐私随机优化有效
机器学习
2024-09-20 v3 密码学与安全
机器学习
摘要
我们研究了批量尺寸如何影响差分隐私随机梯度下降 (DP-SGD) 中的总梯度方差,旨在为大批量尺寸的有效性提供理论解释。作为现代差分隐私深度学习的基础,DP-SGD 的性质已被广泛研究,最近的工作经验性地发现大批量尺寸是有益的。然而,目前对这种益处的理论解释最多只是启发式的。我们首先观察到,DP-SGD 中的总梯度方差可以分解为由子采样引起的方差和由噪声引起的方差。随后我们证明,在迭代次数趋于无穷的极限下,有效噪声引起的方差与批量尺寸无关。剩余的由子采样引起的方差随批量尺寸的增大而减小,因此大批量尺寸降低了有效的总梯度方差。我们通过数值计算确认,当批量尺寸不小且处于非渐近区域时,渐近机制在实际设置中是相关的,并且发现在渐近区域之外,总梯度方差随大批量尺寸的增加而减少得更多。我们还发现了一个充分条件,该条件意味着大批量尺寸同样能减少 DP-SGD 单次迭代的有效差分隐私噪声方差。
引用
@article{arxiv.2402.03990,
title = {Subsampling is not Magic: Why Large Batch Sizes Work for Differentially Private Stochastic Optimisation},
author = {Ossi Räisä and Joonas Jälkö and Antti Honkela},
journal= {arXiv preprint arXiv:2402.03990},
year = {2024}
}
备注
After the publication of this work (ICML 2024), the Conjecture 6.3 has been proven by Kalinin (2024). Kalinin, N. P. Notes on Sampled Gaussian Mechanism. arXiv:2409.04636, 2024