中文

成员推断与隐私审计的样本复杂度

机器学习 2025-08-28 v1 密码学与安全 机器学习

摘要

成员推断攻击获取学习算法的输出及目标个体,试图判断该个体是否为训练数据的成员或来自相同分布的独立样本。成功的成员推断攻击通常需要攻击者对训练数据采样分布的某些知识,这种知识通常通过来自该分布的独立参考样本集合表示。在本工作中,我们研究攻击者完成成员推断所需的知识量,通过调查样本复杂度——完成有效攻击所需的最小参考样本数量来回答此问题。在高斯均值估计的基本设置中,学习算法从高斯分布 N(μ,Σ)\mathcal{N}(\mu,\Sigma) 中获得 nn 个样本,试估计 μ^\hat\mu 以满足 E[μ^μΣ2]ρ2d\mathbb{E}[\|\hat \mu - \mu\|^2_{\Sigma}]\leq \rho^2 d。我们的结果表明,在此设置下,成员推断需要 Ω(n+n2ρ2)\Omega(n + n^2 \rho^2) 个样本才能完成任何与完全知情攻击者竞争的攻击。我们的工作首次表明,攻击者有时需要比训练算法使用的更多样本。此结果对实际应用具有重要意义,因为所有实际攻击都采用受限形式,使用 O(n)O(n) 个样本,无法受益于 ω(n)\omega(n) 个样本。因此,这些攻击可能低估了成员推断的可能性,当分布信息易于获取时,更好的攻击可能是可行的。

关键词

引用

@article{arxiv.2508.19458,
  title  = {The Sample Complexity of Membership Inference and Privacy Auditing},
  author = {Mahdi Haghifam and Adam Smith and Jonathan Ullman},
  journal= {arXiv preprint arXiv:2508.19458},
  year   = {2025}
}

备注

58 Pages