公共数据辅助下的私有随机优化:力量与局限性
机器学习
2024-03-07 v1 密码学与安全
最优化与控制
机器学习
摘要
我们研究公共数据辅助下差分隐私(PA-DP)算法的局限性和能力。 Specifically, 我们关注随机凸优化(SCO)的问题,涉及标记或未标记的公共数据。对于完整/标记的公共数据,我们展示,任何 (ε,δ)-PA-DP 算法的 excess risk 为 Ω ~ ( min { 1 n pub , 1 n + d n ϵ } ) ,其中 d 为维数, n p u b 为公共样本数, n p r i v 为私有样本数, n = n p u b + n p r i v 。这些下界通过我们新的 P A − D P 均值估计下界建立,形式类似。在常数因子水平上,这些下界表明,简单地将所有数据视为私有或丢弃私有数据是最优的。我们还研究 P A − D P 监督学习 w i t h u n l a b e l e d p u b l i c s a m p l e s 。与之前结果不同,我们在这里展示了新方法,用于在私有监督学习中利用公共数据。对于具有 u n l a b e l e d 公共数据的广义线性模型 ( G L M ) ,我们展示了一个高效算法,该算法在给定 \tilde{\Omega}\big(\min\big\{\frac{1}{\sqrt{n_{\text{pub}}}},\frac{1}{\sqrt{n}}+\frac{\sqrt{d}}{n\epsilon} \big\} \big),其中 d 为维数,n_pub 为公共样本数,n_priv 为私有样本数,n=n_pub+n_priv。这些下界通过我们新的 PA-DP 均值估计下界建立,形式类似。在常数因子水平上,这些下界表明,简单地将所有数据视为私有或丢弃私有数据是最优的。我们还研究 PA-DP 监督学习 with unlabeled public samples。与之前结果不同, 我们在这里展示了新方法,用于在私有监督学习中利用公共数据。对于具有 unlabeled 公共数据的广义线性模型(GLM),我们展示了一个高效算法,该算法在给定 Ω ~ ( min { n pub 1 , n 1 + n ϵ d } ) ,其中 d 为维数, n p u b 为公共样本数, n p r i v 为私有样本数, n = n p u b + n p r i v 。这些下界通过我们新的 P A − D P 均值估计下界建立,形式类似。在常数因子水平上,这些下界表明,简单地将所有数据视为私有或丢弃私有数据是最优的。我们还研究 P A − D P 监督学习 w i t h u n l ab e l e d p u b l i cs am pl es 。与之前结果不同,我们在这里展示了新方法,用于在私有监督学习中利用公共数据。对于具有 u n l ab e l e d 公共数据的广义线性模型 ( G L M ) ,我们展示了一个高效算法,该算法在给定 \tilde{O}({n_{\text{priv}}\epsilon})个 u n l a b e l e d 公共样本时, a c h i e v e t h e d i m e n s i o n i n d e p e n d e n t r a t e 个 unlabeled 公共样本时, achieve the dimension independent rate 个 u n l ab e l e d 公共样本时, a c hi e v e t h e d im e n s i o nin d e p e n d e n t r a t e \tilde{O}\big(\frac{1}{\sqrt{{n_{\text{priv}}}} + \frac{1}{\sqrt{{n_{\text{priv}}\epsilon}}\big)。我们发展了新的下界,表明该速率无法通过更多公共样本来改进,任何更少的公共样本都会导致更差的速率。最后,我们为具有有限 fat-shattering dimension 的一般假设类提供了推广,适用于神经网络和非欧几里得几何。
引用
@article{arxiv.2403.03856,
title = {Public-data Assisted Private Stochastic Optimization: Power and Limitations},
author = {Enayat Ullah and Michael Menart and Raef Bassily and Cristóbal Guzmán and Raman Arora},
journal= {arXiv preprint arXiv:2403.03856},
year = {2024}
}