中文

公共数据辅助下的私有随机优化:力量与局限性

机器学习 2024-03-07 v1 密码学与安全 最优化与控制 机器学习

摘要

我们研究公共数据辅助下差分隐私(PA-DP)算法的局限性和能力。 Specifically, 我们关注随机凸优化(SCO)的问题,涉及标记或未标记的公共数据。对于完整/标记的公共数据,我们展示,任何 (ε,δ)-PA-DP 算法的 excess risk 为 Ω~(min{1npub,1n+dnϵ}),其中d为维数,npub为公共样本数,npriv为私有样本数,n=npub+npriv。这些下界通过我们新的PADP均值估计下界建立,形式类似。在常数因子水平上,这些下界表明,简单地将所有数据视为私有或丢弃私有数据是最优的。我们还研究PADP监督学习withunlabeledpublicsamples。与之前结果不同,我们在这里展示了新方法,用于在私有监督学习中利用公共数据。对于具有unlabeled公共数据的广义线性模型(GLM),我们展示了一个高效算法,该算法在给定\tilde{\Omega}\big(\min\big\{\frac{1}{\sqrt{n_{\text{pub}}}},\frac{1}{\sqrt{n}}+\frac{\sqrt{d}}{n\epsilon} \big\} \big),其中 d 为维数,n_pub 为公共样本数,n_priv 为私有样本数,n=n_pub+n_priv。这些下界通过我们新的 PA-DP 均值估计下界建立,形式类似。在常数因子水平上,这些下界表明,简单地将所有数据视为私有或丢弃私有数据是最优的。我们还研究 PA-DP 监督学习 with unlabeled public samples。与之前结果不同, 我们在这里展示了新方法,用于在私有监督学习中利用公共数据。对于具有 unlabeled 公共数据的广义线性模型(GLM),我们展示了一个高效算法,该算法在给定 \tilde{O}({n_{\text{priv}}\epsilon})unlabeled公共样本时,achievethedimensionindependentrate 个 unlabeled 公共样本时, achieve the dimension independent rate \tilde{O}\big(\frac{1}{\sqrt{{n_{\text{priv}}}} + \frac{1}{\sqrt{{n_{\text{priv}}\epsilon}}\big)。我们发展了新的下界,表明该速率无法通过更多公共样本来改进,任何更少的公共样本都会导致更差的速率。最后,我们为具有有限 fat-shattering dimension 的一般假设类提供了推广,适用于神经网络和非欧几里得几何。

关键词

引用

@article{arxiv.2403.03856,
  title  = {Public-data Assisted Private Stochastic Optimization: Power and Limitations},
  author = {Enayat Ullah and Michael Menart and Raef Bassily and Cristóbal Guzmán and Raman Arora},
  journal= {arXiv preprint arXiv:2403.03856},
  year   = {2024}
}